Yann Lecun, científico jefe de IA de Meta y uno de los pioneros de la IA moderna, recientemente argumentó que los modelos de lenguaje grande (LLMS) autorregresivos son fundamentalmente defectuosos. Según él, la probabilidad de generar una respuesta correcta disminuye exponencialmente con cada token, haciéndolos poco prácticos para las interacciones AI confiables y de forma larga.
Si bien respeto profundamente el trabajo y el enfoque de Lecun para el desarrollo de la IA y resuenan con muchas de sus ideas, creo que este reclamo particular pasa por alto algunos aspectos clave de cómo funcionan los LLM en la práctica. En esta publicación, explicaré por qué los modelos autorregresivos no son inherentemente divergentes y condenados, y cómo técnicas como la cadena de pensamiento (cot) y las consultas de razonamiento atento (ARQ), un método que hemos desarrollado para lograr el cliente de alta precisión del cliente interacciones con Parlante—Efectivamente probar lo contrario.
¿Qué es la autorregresión?
En esencia, un LLM es un modelo probabilístico entrenado para generar texto de un token a la vez. Dado un contexto de entrada, el modelo predice la siguiente token más probable, lo alimenta a la secuencia original y repite el proceso de iteración hasta que se cumpla una condición de parada. Esto permite que el modelo genere cualquier cosa, desde respuestas cortas hasta artículos completos.
Para una inmersión más profunda en la autorregresión, consulte nuestro reciente publicación de blog técnico.
¿Los errores de generación se componen exponencialmente?
El argumento de Lecun se puede desempaquetar de la siguiente manera:
- Definir do Como el conjunto de todas las finalizaciones posibles de longitud norte.
- Definir A ⊂ C como subconjunto de terminaciones aceptables, donde U = C – A representa los inaceptables.
- Dejar CI[K] ser una finalización en progreso de la longitud Kque en K sigue siendo aceptable (CI[N] ∈ A todavía puede aplicarse en última instancia).
- Asumir una constante mi Como la probabilidad de error de generar el siguiente token, de modo que empuje CI en U.
- La probabilidad de generar los tokens restantes mientras mantiene CI en A es entonces (1 – E)^(N – K).
Esto lleva a la conclusión de Lecun de que para respuestas suficientemente largas, la probabilidad de mantener la coherencia se acerca exponencialmente a cero, lo que sugiere que los LLM autorregresivos son inherentemente defectuosos.
Pero aquí está el problema: E no es constante.
En pocas palabras, el argumento de Lecun supone que la probabilidad de cometer un error en cada nuevo token es independiente. Sin embargo, los LLM no funcionan de esa manera.
Como analogía para lo que permite que LLM supere este problema, imagine que está contando una historia: si comete un error en una oración, aún puede corregirlo en el siguiente para mantener la narrativa coherente. Lo mismo se aplica a los LLM, especialmente cuando las técnicas como la cadena de pensamiento (COT), lo que solicita, los guía hacia un mejor razonamiento ayudándoles a reevaluar sus propias salidas en el camino.
Por qué esta suposición es defectuosa
Exhibición de LLMS Propiedades de autocorrección que les impiden espiral en incoherencia.
Llevar Cadena de pensamiento (COT) Involucrarque alienta al modelo a generar pasos de razonamiento intermedios. COT permite que el modelo considere múltiples perspectivas, mejorando su capacidad de converger a una respuesta aceptable. Similarmente, Cadena de verificación (CoV) y los mecanismos de retroalimentación estructurados como ARQS guían el modelo para reforzar salidas válidas y descartar los erróneos.
Un pequeño error al principio en el proceso de generación no necesariamente condenan la respuesta final. En sentido figurado, un LLM puede verificar su trabajo, retroceder y corregir errores sobre la marcha.
Las consultas de razonamiento atento (ARQ) son un cambio de juego
En Parlantehemos llevado este principio más allá en nuestro trabajo en Consultas de razonamiento atento (Un trabajo de investigación que describe nuestros resultados está actualmente en proceso, pero el patrón de implementación se puede explorar en nuestra base de código de código abierto). Los ARQ introducen planos de razonamiento que ayudan al modelo a mantener la coherencia a lo largo de largas finalizaciones reenfocando dinámicamente la atención en las instrucciones clave en puntos estratégicos en el proceso de finalización, evitando continuamente que los LLM se divergen en incoherencia. Utilizándolos, hemos podido mantener un conjunto de pruebas grande que exhibe una consistencia cercana al 100% en la generación de terminaciones correctas para tareas complejas.
Esta técnica nos permite lograr una precisión mucho mayor en el razonamiento y el seguimiento de las instrucciones impulsados por la IA, lo que ha sido fundamental para nosotros al habilitar aplicaciones confiables y alineadas orientadas al cliente.
Los modelos autorregresivos están aquí para quedarse
Creemos que los LLM autorregresivos están lejos de ser condenados. Si bien la coherencia de forma larga es un desafío, suponiendo una tasa de error compuesta exponencialmente ignora los mecanismos clave que mitigan la divergencia—De razonamiento de la cadena de pensamiento hasta razonamiento estructurado como ARQ.
Si está interesado en la alineación de la IA y el aumento de la precisión de los agentes de chat utilizando LLM, no dude en explorar Parlant’s esfuerzo de código abierto. Continuemos refinando cómo generan y estructuramos el conocimiento.
Descargo de responsabilidad: Las opiniones y opiniones expresadas en este artículo invitado son las del autor y no reflejan necesariamente la política o posición oficial de MarktechPost.
Yam Marcovitz es el líder tecnológico de Parlant y CEO en EMCIE. Un experimentado constructor de software con una amplia experiencia en software de misión crítica y arquitectura del sistema, los antecedentes de Yam informan su enfoque distintivo para desarrollar sistemas de IA controlables, predecibles y alineados.