MemoryFormer: una novedosa arquitectura transformadora para modelos de lenguaje grandes eficientes y escalables

Los modelos de transformadores han impulsado avances revolucionarios en inteligencia artificial, impulsando aplicaciones en el procesamiento del lenguaje natural, la visión por computadora y el reconocimiento de voz. Estos modelos destacan por comprender y generar datos secuenciales aprovechando mecanismos como la atención de múltiples cabezas para capturar relaciones dentro de las secuencias de entrada. El auge de los grandes modelos de lenguaje (LLM) construidos sobre transformadores ha amplificado estas capacidades, permitiendo tareas que van desde razonamiento complejo hasta generación de contenido creativo.

Sin embargo, el tamaño y la complejidad cada vez mayores de los LLM tienen como costo la eficiencia computacional. Estos modelos dependen en gran medida de capas totalmente conectadas y operaciones de atención de múltiples cabezales, que exigen importantes recursos. En la mayoría de los escenarios prácticos, las capas completamente conectadas dominan la carga computacional, lo que dificulta escalar estos modelos sin incurrir en altos costos de energía y hardware. Esta ineficiencia restringe su accesibilidad y escalabilidad en industrias y aplicaciones más amplias.

Se han propuesto varios métodos para abordar los cuellos de botella computacionales en los modelos de transformadores. Técnicas como la poda de modelos y la cuantificación del peso han mejorado moderadamente la eficiencia al reducir el tamaño y la precisión del modelo. El rediseño del mecanismo de autoatención, como la atención lineal y flash, ha disminuido su complejidad computacional de cuadrática a lineal en cuanto a la longitud de la secuencia. Sin embargo, estos enfoques a menudo necesitan prestar más atención a la contribución de las capas completamente conectadas, dejando una parte sustancial del cálculo sin optimizar.

Investigadores de la Universidad de Pekín, el Laboratorio Arca de Noé de Huawei y HiSilicon de Huawei presentaron MemoryFormer. Esta arquitectura transformadora elimina las costosas capas computacionalmente conectadas y las reemplaza por capas de memoria. Estas capas utilizan tablas de búsqueda en memoria y algoritmos de hash sensibles a la localidad (LSH). MemoryFormer tiene como objetivo transformar las incrustaciones de entrada recuperando de la memoria representaciones vectoriales precalculadas en lugar de realizar multiplicaciones de matrices convencionales.

La principal innovación de MemoryFormer radica en su diseño Memory Layer. En lugar de realizar proyecciones lineales directamente, las incrustaciones de entrada se procesan mediante un algoritmo hash sensible a la localidad. Este proceso asigna incrustaciones similares a las mismas ubicaciones de memoria, lo que permite que el modelo recupere vectores prealmacenados que se aproximan a los resultados de las multiplicaciones de matrices. Al dividir las incrustaciones en fragmentos más pequeños y procesarlas de forma independiente, MemoryFormer reduce los requisitos de memoria y la carga computacional. La arquitectura también incorpora vectores que se pueden aprender dentro de tablas hash, lo que permite entrenar el modelo de un extremo a otro mediante propagación hacia atrás. Este diseño garantiza que MemoryFormer pueda manejar diversas tareas manteniendo la eficiencia.

MemoryFormer demostró un rendimiento y una eficiencia excepcionales durante los experimentos realizados en múltiples puntos de referencia de PNL. Para longitudes de secuencia de 2048 tokens, MemoryFormer redujo la complejidad computacional de capas completamente conectadas en más de un orden de magnitud. Los FLOP computacionales para MemoryFormer se redujeron a solo el 19 % de los requisitos de un bloque transformador estándar. En tareas específicas, como PIQA y ARC-E, MemoryFormer logró puntuaciones de precisión de 0,698 y 0,585, respectivamente, superando los modelos de transformadores básicos. La precisión promedio general en las tareas evaluadas también mejoró, lo que destaca la capacidad del modelo para mantener o mejorar el rendimiento y, al mismo tiempo, reducir significativamente la sobrecarga computacional.

Los investigadores compararon MemoryFormer con métodos de transformación eficientes existentes, incluidos Linformer, Performer y Cosformer. MemoryFormer superó consistentemente a estos modelos en términos de eficiencia computacional y precisión de referencia. Por ejemplo, en comparación con Performer y Linformer, que lograron precisiones promedio de 0,418 y 0,398, respectivamente, MemoryFormer alcanzó 0,458 utilizando menos recursos. Estos resultados subrayan la eficacia de su capa de memoria a la hora de optimizar las arquitecturas de transformadores.

En conclusión, MemoryFormer aborda las limitaciones de los modelos de transformadores minimizando las demandas computacionales mediante el uso innovador de capas de memoria. Los investigadores demostraron un enfoque transformador para equilibrar el rendimiento y la eficiencia mediante la sustitución de capas totalmente conectadas con operaciones con memoria eficiente. Esta arquitectura proporciona una vía escalable para implementar grandes modelos de lenguaje en diversas aplicaciones, garantizando accesibilidad y sostenibilidad sin comprometer la precisión o la capacidad.


Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de telegramas y LinkedIn Grarriba. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa.. No olvides unirte a nuestro SubReddit de más de 55.000 ml.

[FREE AI VIRTUAL CONFERENCE] SmallCon: Conferencia virtual gratuita sobre GenAI con Meta, Mistral, Salesforce, Harvey AI y más. Únase a nosotros el 11 de diciembre en este evento virtual gratuito para aprender lo que se necesita para construir a lo grande con modelos pequeños de pioneros de la IA como Meta, Mistral AI, Salesforce, Harvey AI, Upstage, Nubank, Nvidia, Hugging Face y más.


Nikhil es consultor interno en Marktechpost. Está cursando una doble titulación integrada en Materiales en el Instituto Indio de Tecnología de Kharagpur. Nikhil es un entusiasta de la IA/ML que siempre está investigando aplicaciones en campos como los biomateriales y la ciencia biomédica. Con una sólida formación en ciencia de materiales, está explorando nuevos avances y creando oportunidades para contribuir.