¿Puede la regresión simbólica ser la clave para transformar modelos opacos de aprendizaje profundo en ecuaciones matemáticas interpretables y de forma cerrada? o Digamos que ha entrenado su modelo de aprendizaje profundo. Funciona. ¿Pero sabes lo que realmente ha aprendido? Un equipo de investigadores de la Universidad de Cambridge propone ‘SymTorch’, una biblioteca diseñada para integrar la regresión simbólica (SR) en flujos de trabajo de aprendizaje profundo. Permite a los investigadores aproximar los componentes de la red neuronal con expresiones matemáticas de forma cerrada, lo que facilita la interpretabilidad funcional y la posible aceleración de la inferencia.
Mecanismo central: el flujo de trabajo Wrap-Distill-Switch
SymTorch simplifica la ingeniería necesaria para extraer ecuaciones simbólicas de modelos entrenados al automatizar el movimiento de datos y la gestión de enlaces.
Wrap: los usuarios aplican el contenedor SymbolicModel a cualquier nn.Module o función invocable. Destilar: la biblioteca registra enlaces directos para registrar activaciones de entrada y salida durante un pase directo. Estos se almacenan en caché y se transfieren de la GPU a la CPU para una regresión simbólica a través de PySR. Cambiar: una vez destilados, los pesos neuronales originales se pueden reemplazar con la ecuación descubierta en el pase directo usando switch_to_symbolic.
La biblioteca interactúa con PySR, que utiliza un algoritmo genético de poblaciones múltiples para encontrar ecuaciones que equilibren la precisión y la complejidad en un frente de Pareto. La “mejor” ecuación se elige maximizando la caída fraccionaria en el error absoluto medio logarítmico en relación con un aumento en la complejidad.
Estudio de caso: Acelerar la inferencia LLM
Una aplicación principal explorada en esta investigación es reemplazar las capas de perceptrón multicapa (MLP) en modelos Transformer con sustitutos simbólicos para mejorar el rendimiento.
Detalles de implementación
Debido a la alta dimensionalidad de las activaciones de LLM, el equipo de investigación empleó el Análisis de Componentes Principales (PCA) para comprimir las entradas y salidas antes de realizar la SR. Para el modelo Qwen2.5-1.5B, seleccionaron 32 componentes principales para entradas y 8 para salidas en tres capas específicas.
Compensaciones de rendimiento
La intervención resultó en un aumento del 8,3% en el rendimiento de los tokens. Sin embargo, esta ganancia vino acompañada de un aumento no trivial de la perplejidad, impulsada principalmente por la reducción de la dimensionalidad del PCA más que por la aproximación simbólica en sí.
GNN y PINN
SymTorch fue validada por su capacidad para recuperar leyes físicas conocidas a partir de representaciones latentes en modelos científicos.
Graficar redes neuronales (GNN): al entrenar un GNN en dinámica de partículas, el equipo de investigación utilizó SymTorch para recuperar leyes de fuerza empíricas, como la gravedad (1/r2) y las fuerzas de resorte, directamente a partir de los mensajes de borde. Redes neuronales informadas por la física (PINN): la biblioteca destiló con éxito la solución analítica de la ecuación de calor 1-D a partir de un PINN entrenado. El sesgo inductivo del PINN le permitió alcanzar un error cuadrático medio (MSE) de 7,40 x 10-6. Análisis aritmético de LLM: se utilizó destilación simbólica para inspeccionar cómo modelos como Llama-3.2-1B realizan sumas y multiplicaciones de 3 dígitos. Las ecuaciones resumidas revelaron que, si bien los modelos suelen ser correctos, se basan en heurísticas internas que incluyen errores numéricos sistemáticos.
Conclusiones clave
Destilación simbólica automatizada: SymTorch es una biblioteca que automatiza el proceso de reemplazar componentes complejos de redes neuronales con ecuaciones matemáticas interpretables y de forma cerrada envolviendo componentes y recopilando su comportamiento de entrada-salida. Eliminación de barreras de ingeniería: la biblioteca maneja desafíos de ingeniería críticos que anteriormente obstaculizaban la adopción de la regresión simbólica, incluida la transferencia de datos GPU-CPU, el almacenamiento en caché de entrada y salida y la conmutación perfecta entre pases directos neuronales y simbólicos. Aceleración de inferencia LLM: una prueba de concepto demostró que reemplazar las capas MLP en un modelo de transformador con sustitutos simbólicos logró una mejora del rendimiento del 8,3 %, aunque con cierta degradación del rendimiento por la perplejidad. Descubrimiento de leyes científicas: SymTorch se utilizó con éxito para recuperar leyes físicas de redes neuronales gráficas (GNN) y soluciones analíticas a la ecuación de calor 1-D de redes neuronales informadas por la física (PINN). Interpretabilidad funcional de los LLM: al destilar el comportamiento de un extremo a otro de los LLM, los investigadores podrían inspeccionar las heurísticas matemáticas explícitas utilizadas para tareas como la aritmética, revelando dónde se desvía la lógica interna de las operaciones exactas.
Consulte la página de artículos, repositorios y proyectos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
Max es un analista de IA en MarkTechPost, con sede en Silicon Valley, que da forma activamente al futuro de la tecnología. Enseña robótica en Brainvyne, combate el spam con ComplyEmail y aprovecha la IA a diario para traducir avances tecnológicos complejos en conocimientos claros y comprensibles.