Los investigadores de Meta AI introdujeron un modelo autorregresivo de red automático de nivel de bytes escalable que supera a los transformadores basados ​​en tokens en los puntos de referencia de modelado de idiomas

El modelado de idiomas juega un papel fundamental en el procesamiento del lenguaje natural, lo que permite a las máquinas predecir y generar texto que se asemeja al lenguaje humano. Estos modelos han evolucionado significativamente, comenzando con métodos estadísticos y progresando a través de las arquitecturas neuronales a los sistemas basados ​​en transformadores a gran escala actual. En el centro de muchas aplicaciones, como chatbots, herramientas de traducción y motores de finalización de texto, los modelos de lenguaje interpretan y generan secuencias de palabras o bytes. Su efectividad depende en gran medida de la arquitectura subyacente y las representaciones de datos utilizadas. A medida que crece la demanda de modelos más eficientes y escalables, los investigadores continúan explorando nuevas estructuras y métodos de entrenamiento para mejorar el rendimiento, manejar contextos más largos y reducir la carga computacional. Entre estos esfuerzos, la combinación de ideas de arquitecturas convolucionales con predicción autorregresiva ha surgido como un enfoque intrigante.

Desafíos con la tokenización y los modelos de idiomas basados ​​en transformadores

Uno de los principales problemas con el modelado de idiomas es el uso excesivo de modelos basados ​​en tokens y modelos de transformadores, que son computacionalmente costosos y generalmente ineficientes para procesarse a nivel de byte o incluso en todos los idiomas. Técnicas, como las longitudes de la secuencia de control de la codificación de pares de bytes, pero crean inconsistencias entre idiomas y dominios. Los transformadores, aunque precisos, carecen de escalabilidad debido a su complejidad cuadrática. Aunque los enfoques competitivos, como la atención escasa, intentan resolver este problema, generalmente lo hacen a expensas de la simplicidad o el rendimiento. El modelado a nivel de byte con transformadores planos ha demostrado solo un éxito parcial, lo que subraya la necesidad de nuevas arquitecturas que puedan procesar entradas de bytes sin procesar sin tokenización al tiempo que alcanza un excelente rendimiento.

Introducción de Au-Net: un modelo de idioma de nivel de bytes sin token

Investigadores de Fair en Meta, Tau, Inria y Lisn, CNRS y Université Paris-Saclay, Insa Rouen Normandy, Litis, Rouen, Francia, introdujeron una nueva red U (Au-Net) autorregresiva. Este modelo integra las ideas de diseños convolucionales de la red en U con procesos de decodificación autorregresivos. A diferencia de los sistemas de transformadores, Au-Net no requiere tokenización y funciona directamente en bytes. La arquitectura está diseñada para habilitar la generación paralela y eficiente, con la autonomía para incorporar capacidades autorregresivas. Logra esto codificando jerárquicamente las convoluciones muestreadas y luego las etapas de muestreo ascendente, que restauran el tamaño de la secuencia original. En particular, Au-Net presenta un mecanismo de división que permite realizar predicciones sobre subsegmentos de la secuencia, mejorando la escalabilidad. Este cambio de diseño también garantiza que la complejidad del modelo aumente linealmente con la longitud de secuencia, en lugar de cuadráticamente. Los investigadores implementaron este modelo en varios puntos de referencia de modelado de idiomas y tareas multilingües para probar su efectividad en entornos de baja recursos y a gran escala.

Arquitectura de Au-Net: codificación múltiple e inferencia paralela

La arquitectura de Au-Net se implementa con múltiples etapas de escala que reducen y luego reconstruyen secuencias de entrada utilizando convoluciones con Strides. Durante el entrenamiento, cada segmento de la secuencia de entrada se predice de manera enmascarada para mantener la propiedad autorregresiva. El modelo utiliza una función de división aprendida para dividir las secuencias de entrada en grupos no superpuestos, que luego se predicen simultáneamente y se combinan en una salida completa. Admite configuraciones tanto superficiales como profundas, con modelos que van del 3% al 75% del presupuesto de cálculo de capacitación en comparación con las líneas de base estándar. Por ejemplo, una configuración capacitada en tokens 200B con 8 mil millones de parámetros logró resultados altamente competitivos. Otra versión, entrenada en 60 mil millones de tokens con un modelo de mil millones de parámetros, logró un puntaje de 35.7 BLEU en tareas de traducción estándar, superando a los modelos de referencia entrenados en los mismos datos. Además, Au-Net demostró velocidades de generación más rápidas debido a su decodificación paralela, ofreciendo un beneficio significativo para las aplicaciones sensibles a la latencia.

Los resultados de referencia muestran una ventaja competitiva sobre los transformadores

Los resultados experimentales mostraron un fuerte rendimiento en una amplia gama de tareas. En ENWIK8, un punto de referencia de compresión a nivel de byte, Au-Net logró 1.01 bits por byte, superando una línea de base del transformador que alcanzó solo 1.02 bits por byte. En PG-19, una tarea de modelado de lenguaje de contexto largo, el modelo logró 2.61 bits por byte en comparación con 2.75 de transformadores estándar. AU-NET también se amplió de manera efectiva a través de los presupuestos de cálculo, logrando 43.3 Bleu en la traducción de Flores-200 con un tamaño de modelo 8B entrenado en tokens 200B. En la evaluación multilingüe utilizando Flores-200, el modelo superó a los transformadores basados ​​en token en pares de idiomas de baja recursos. También demostró una mejor generalización interlingual dentro de las familias de idiomas, logrando un puntaje BLEU de hasta 33.0 en varias configuraciones. Cuando se evalúa bajo presupuestos de datos y datos iguales, Au-Net, ya sea coincidentes o superformó a los transformadores, con velocidades de generación que mejoran en un 20% a 30% en ciertos entornos.

Contribuciones clave y conocimientos de rendimiento de Au-Net

  • Au-Net elimina la necesidad de tokenización al operar directamente en entradas de bytes sin procesar.
  • En ENWIK8, AU-NET obtuvo 1.01 BPB, superando las líneas de base del transformador con 1.02 BPB.
  • En PG-19, logró 2.61 BPB, mejorando sobre los 2.75 BPB de transformadores estándar.
  • La evaluación multilingüe de FLORES-2000 mostró hasta 33.0 BLU, superando los sistemas basados ​​en tokens.
  • Los modelos de nivel de byte entrenados con Au-Net mantuvieron un alto rendimiento en entornos de alta recursos y de baja recursos.
  • La velocidad de generación mejoró en un 20 %–30 %, lo que respalda la inferencia rápida y paralela.
  • Leyes de escala mantenidas; El rendimiento mejoró con un mayor tamaño del modelo y datos.
  • El modelo mostró una mejor generalización multilingüe y robustez al ruido.
  • Uso eficiente de cómputo; Au-Net coincidió o excedió el rendimiento del transformador con presupuestos de cómputo más bajos.
  • Au-Net es una alternativa viable para tareas de modelado de lenguaje a gran escala, incluidas aplicaciones multilingües y de nivel de bytes.

Conclusión: beneficios prácticos de Au-Net y potencial de escalabilidad

En conclusión, los investigadores proporcionaron análisis de escala detallados que muestran que Au-Net se adhiere a las leyes predecibles de escala de hiperparameter. Se beneficia del aumento del tamaño del modelo y las fichas de entrenamiento de manera consistente con las prácticas observadas en los modelos de transformadores. Por ejemplo, bajo la configuración de entrenamiento coincidente, el rendimiento de Au-Net mejoró constantemente con una mayor relación de datos a modelo, coincidiendo con las ganancias observadas en las contrapartes del transformador. Es importante destacar que Au-Net pudo escalar a modelos con 8 mil millones de parámetros, demostrando una capacitación efectiva y demostrando que la arquitectura es capaz de soportar sistemas de alta capacidad. En evaluaciones extendidas, el modelo mantuvo su eficiencia cuando se aplicó a tareas aguas abajo, mostrando un fuerte rendimiento en la generación de idiomas, la traducción y los puntos de referencia de predicción a nivel de bytes. AU-NET también demostró ser más fácil de entrenar y más robusto en condiciones de entrada ruidosas en comparación con los modelos basados ​​en token.

¿Por qué esta investigación es importante?

Esta investigación es importante porque desafía la dependencia de larga data de los modelos de idiomas basados ​​en token al introducir AU-NET, una arquitectura autorregresiva a nivel de bytes que elimina la sobrecarga de tokenización al tiempo que alcanza un rendimiento competitivo o superior. Al procesar bytes sin procesar directamente y escalar eficientemente con complejidad lineal, Au-Net aborda limitaciones clave de los modelos de transformadores, es decir, su escala cuadrática y su dependencia de vocabularios fijos. Sus fuertes resultados a través de puntos de referencia multilingües y de contexto largo, especialmente en entornos de baja recursos, resaltan su potencial para construir sistemas de PNL más eficientes, inclusivos y generalizables. Esto posiciona AU-Net como una alternativa prometedora para futuros esfuerzos de modelado de idiomas a gran escala.


Mira el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.