El modelado del lenguaje en la inteligencia artificial se centra en el desarrollo de sistemas que puedan comprender, interpretar y generar el lenguaje humano. Este campo abarca diversas aplicaciones, como la traducción automática, el resumen de textos y los agentes conversacionales. Los investigadores pretenden crear modelos que imiten las capacidades lingüísticas humanas, lo que permite una interacción fluida entre humanos y máquinas. Los avances en este campo han llevado al desarrollo de modelos cada vez más complejos y grandes que requieren recursos computacionales sustanciales.
La creciente complejidad y el tamaño de los grandes modelos lingüísticos (LLM) dan lugar a importantes costes de formación e inferencia. Estos costes surgen de la necesidad de codificar grandes cantidades de conocimiento en parámetros de modelo, que requieren un uso intensivo de recursos y son costosos desde el punto de vista computacional. A medida que aumenta la demanda de modelos más potentes, el reto de gestionar estos costes se hace más evidente. Abordar este problema es crucial para el desarrollo sostenible de las tecnologías de modelado lingüístico.
Los métodos existentes para mitigar estos costos implican la optimización de varios aspectos de los LLM, como su arquitectura, la calidad de los datos y la paralelización. Los modelos de generación aumentada por recuperación (RAG), por ejemplo, utilizan bases de conocimiento externas para reducir la carga sobre los parámetros del modelo. Sin embargo, estos modelos aún dependen en gran medida de grandes tamaños de parámetros, lo que limita su eficiencia. Otros enfoques incluyen la mejora de la calidad de los datos y el uso de hardware avanzado, pero estas soluciones solo abordan parcialmente el problema subyacente de los altos costos computacionales.
Investigadores del Instituto de Investigación de Algoritmos Avanzados de Shanghái, Moqi Inc. y el Centro de Investigación de Aprendizaje Automático de la Universidad de Pekín han presentado el Memory3 Este nuevo enfoque incorpora la memoria explícita en los modelos de lenguaje. Este modelo externaliza una parte significativa del conocimiento, lo que permite que el modelo mantenga un tamaño de parámetro más pequeño. La introducción de la memoria explícita representa un cambio de paradigma en la forma en que los modelos de lenguaje almacenan y recuperan el conocimiento.
Memoria3 Utiliza memorias explícitas, que son más baratas de almacenar y recuperar que los parámetros del modelo tradicional. Este diseño incluye un mecanismo de esparcimiento de la memoria y un esquema de preentrenamiento de dos etapas para facilitar la formación eficiente de la memoria. El modelo convierte textos en memorias explícitas, que pueden recuperarse durante la inferencia, lo que reduce los costos computacionales generales. La memoria3 La arquitectura está diseñada para ser compatible con los LLM basados en Transformer existentes, lo que requiere un ajuste fino mínimo. Esta adaptabilidad garantiza que la memoria3 El modelo puede adoptarse ampliamente sin realizar grandes modificaciones en el sistema. La base de conocimientos comprende 1,1 × 108 fragmentos de texto, cada uno con una longitud de hasta 128 tokens, almacenados y procesados de manera eficiente.
La memoria3 El modelo, con 2.400 millones de parámetros no integrados, superó a los modelos LLM y RAG más grandes. Logró un mejor rendimiento de referencia, demostrando una eficiencia y precisión superiores. Específicamente, Memory3 El modelo RAG mostró una velocidad de decodificación superior a la de los modelos RAG, ya que no dependía de procesos extensos de recuperación de texto. Además, el desempeño en tareas profesionales, que implicaban la recuperación de alta frecuencia de memorias explícitas, mostró la robustez y la adaptabilidad del modelo a diversas aplicaciones. La integración de memorias explícitas redujo significativamente la carga computacional, lo que permitió un procesamiento más rápido y eficiente.
La memoria3 El modelo demostró resultados impresionantes. Mostró un aumento del 2,51 % en las puntuaciones promedio debido a la memoria explícita en comparación con los modelos sin esta característica. En tareas específicas, la memoria3 El modelo obtuvo una puntuación de 83,3 en HellaSwag y 80,4 en BoolQ, superando a un modelo de parámetros más grande de 9,1 mil millones, que obtuvo una puntuación de 70,6 y 70,7, respectivamente. La velocidad de decodificación del modelo fue un 35,2 % más lenta sin usar memoria, lo que indica un uso eficiente de la memoria. Además, el mecanismo de memoria explícita redujo el requisito total de almacenamiento de memoria de 7,17 PB a 45,9 TB, lo que lo hace más práctico para aplicaciones a gran escala.
Para concluir, la Memoria3 Este modelo representa un avance significativo en la reducción del costo y la complejidad de la capacitación y el funcionamiento de modelos lingüísticos de gran tamaño. Los investigadores ofrecen una solución más eficiente y escalable que mantiene un alto rendimiento y precisión al externalizar parte del conocimiento en memorias explícitas. Este enfoque innovador aborda el problema acuciante de los costos computacionales en el modelado lingüístico, allanando el camino para tecnologías de IA más sostenibles y accesibles.
Revisar la PapelTodo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo.
Únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro Subreddit de más de 46 000 millones de usuarios
Nikhil es consultor en prácticas en Marktechpost. Está cursando una doble titulación integrada en Materiales en el Instituto Indio de Tecnología de Kharagpur. Nikhil es un entusiasta de la IA y el aprendizaje automático que siempre está investigando aplicaciones en campos como los biomateriales y la ciencia biomédica. Con una sólida formación en ciencia de los materiales, está explorando nuevos avances y creando oportunidades para contribuir.