En el panorama en rápida evolución del aprendizaje automático y la inteligencia artificial, comprender las representaciones fundamentales dentro de los modelos de transformadores se ha convertido en un desafío de investigación crítico. Los investigadores están lidiando con interpretaciones contrapuestas de lo que representan los transformadores, ya sea que funcionen como imitadores estadísticos, modelos mundiales o algo más complejo. La intuición central sugiere que los transformadores podrían capturar la dinámica estructural oculta de los procesos de generación de datos, permitiendo una predicción compleja del siguiente token. Esta perspectiva fue expresada notablemente por destacados investigadores de IA que sostienen que una predicción precisa de tokens implica una comprensión más profunda de las realidades generativas subyacentes. Sin embargo, los métodos tradicionales carecen de un marco sólido para analizar estas representaciones computacionales.
Las investigaciones existentes han explorado varios aspectos de las representaciones internas y las limitaciones computacionales de los modelos de transformadores. El marco “Future Lens” reveló que los estados ocultos del transformador contienen información sobre múltiples tokens futuros, lo que sugiere una representación similar a un estado de creencia. Los investigadores también han investigado las representaciones de transformadores en juegos secuenciales como Otelo, interpretando estas representaciones como posibles “modelos mundiales” de estados del juego. Los estudios empíricos han demostrado las limitaciones de las tareas algorítmicas de los transformadores en la búsqueda de rutas de gráficos y en los modelos ocultos de Markov (HMM). Además, los modelos predictivos bayesianos han intentado proporcionar información sobre las representaciones de las máquinas de estados, estableciendo conexiones con el enfoque de presentación de estados mixtos en la mecánica computacional.
Investigadores de PIBBSS, Pitzer and Scripps College y University College London, Timaeus han propuesto un enfoque novedoso para comprender la estructura computacional de modelos de lenguaje grande (LLM) durante la predicción del siguiente token. Su investigación se centra en descubrir la metadinámica de la actualización de creencias sobre estados ocultos de los procesos de generación de datos. Se encuentra que los estados de creencia se representan linealmente en flujos residuales de transformadores con la ayuda de la teoría de predicción óptima, incluso cuando la geometría del estado de creencia predicha muestra estructuras fractales complejas. Además, el estudio explora cómo estos estados de creencias se representan en el flujo residual final o se distribuyen en múltiples flujos de capas.
La metodología propuesta utiliza un enfoque experimental detallado para analizar modelos de transformadores entrenados con datos generados por HMM. Los investigadores se centran en examinar las activaciones de flujos residuales en diferentes capas y posiciones de ventanas de contexto, creando un conjunto de datos completo de vectores de activación. Para cada secuencia de entrada, el marco determina el estado de creencia correspondiente y su distribución de probabilidad asociada sobre los estados ocultos del proceso generativo. Los investigadores utilizan la regresión lineal para establecer un mapeo afín entre las activaciones de la corriente residual y las probabilidades de los estados de creencia. Este mapeo se logra minimizando el error cuadrático medio entre los estados de creencia predichos y verdaderos, lo que da como resultado una matriz de ponderación que proyecta representaciones de flujo residual en la probabilidad simplex.
La investigación arrojó importantes conocimientos sobre la estructura computacional de los transformadores. El análisis de regresión lineal revela un subespacio bidimensional dentro de activaciones residuales de 64 dimensiones que coincide estrechamente con la estructura fractal predicha de los estados de creencia. Este hallazgo proporciona evidencia convincente de que los transformadores entrenados con datos con estructuras generativas ocultas aprenden a representar geometrías de estados de creencias en su flujo residual. Los resultados empíricos demostraron diversas correlaciones entre la geometría del estado de creencia y las predicciones del siguiente token en diferentes procesos. Para el proceso RRXOR, la geometría del estado de creencias mostró una fuerte correlación (R² = 0,95), superando significativamente las correlaciones de predicción del siguiente token (R² = 0,31).
En conclusión, los investigadores presentan un marco teórico para establecer una conexión directa entre la estructura de datos de entrenamiento y las propiedades geométricas de las activaciones de redes neuronales transformadoras. Al validar la representación lineal de la geometría del estado de creencia dentro de la corriente residual, el estudio revela que los transformadores desarrollan representaciones predictivas mucho más complejas que la simple predicción del siguiente token. La investigación ofrece un camino prometedor hacia una mejor interpretabilidad, confiabilidad y mejoras potenciales del modelo al concretar la relación entre las estructuras computacionales y los datos de entrenamiento. También cierra la brecha crítica entre las capacidades conductuales avanzadas de los LLM y la comprensión fundamental de su dinámica de representación interna.
Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de telegramas y LinkedIn Grarriba. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa.. No olvides unirte a nuestro SubReddit de más de 60.000 ml.
🚨 [Must Attend Webinar]: ‘Transformar pruebas de concepto en aplicaciones y agentes de IA listos para producción’ (Promovido)
Sajjad Ansari es un estudiante de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA centrándose en comprender el impacto de las tecnologías de IA y sus implicaciones en el mundo real. Su objetivo es articular conceptos complejos de IA de una manera clara y accesible.
