Investigadores de la Universidad de Tsinghua y Microsoft AI revelan un gran avance en la formación de modelos de lenguaje: el camino hacia una eficiencia óptima del aprendizaje

Con el auge de los modelos de lenguaje, se ha prestado enorme atención a mejorar el aprendizaje de los LM para acelerar la velocidad de aprendizaje y lograr un cierto rendimiento del modelo con la menor cantidad de pasos de entrenamiento posible. Este énfasis ayuda a los humanos a comprender los límites de los LM en medio de sus crecientes requisitos computacionales. También promueve la democratización de los grandes modelos lingüísticos (LLM), beneficiando a las comunidades de investigación e industria.

Trabajos anteriores como Modelos previamente entrenados, Pasado, Presente y Futuro, se centran en diseñar arquitecturas efectivas, utilizar contextos ricos y mejorar la eficiencia computacional. En h2oGPT: democratización de modelos de lenguaje grandes, los investigadores intentaron crear alternativas de código abierto a los enfoques de código cerrado. En Optimización de lotes grandes para aprendizaje profundo: capacitación de BERT en 76 minutos, intentaron superar el desafío computacional de los LLM. Estos trabajos anteriores exploran métodos prácticos de aceleración a nivel de modelo, optimizador o datos.

Los investigadores del Grupo CoAI, la Universidad de Tsinghua y Microsoft Research han propuesto una teoría para optimizar el aprendizaje LM, comenzando por maximizar la tasa de compresión de datos. Ellos derivan el Teorema de la ley de aprendizaje para dilucidar la dinámica óptima de aprendizaje. Los experimentos de validación sobre tareas de clasificación lineal y modelado de lenguaje confirman las propiedades del teorema. Los resultados indican que el aprendizaje óptimo de LM mejora los coeficientes en las leyes de escala de LM, lo que ofrece implicaciones prometedoras para los métodos prácticos de aceleración del aprendizaje.

En su método (Aprendizaje óptimo de modelos de lenguaje), los investigadores demostraron los principios de optimización de la velocidad de aprendizaje de LM, incluido el objetivo de optimización, la propiedad de una dinámica de aprendizaje óptima y la mejora esencial de la aceleración del aprendizaje. Para el objetivo de optimización, han propuesto minimizar el área bajo la curva (AUC), un proceso de aprendizaje con la menor pérdida AUC corresponde a la mayor relación de compresión. Luego, derivaron la Ley de aprendizaje teorema que caracteriza la propiedad de la dinámica en el proceso de aprendizaje LM de que logra el óptimo de su objetivo. Aquí, una política de aprendizaje induce un proceso de aprendizaje que determina qué puntos de datos aprende el LM a medida que avanza la capacitación.

Después de realizar experimentos sobre clasificación lineal con Perceptron y modelado del lenguaje con Transformer, los investigadores optimizaron las políticas de aprendizaje y las validaron empíricamente. Las políticas casi óptimas aceleraron significativamente el aprendizaje, mejorando el AUC de pérdida en 5,50 × y 2,41 × para Perceptron y Transformer, respectivamente. Los resultados confirmaron las predicciones teóricas, demostrando coeficientes de ley de escala mejorados hasta en un 96,6% y un 21,2%, lo que promete un entrenamiento LM más rápido con importancia práctica.

En conclusión, investigadores del Grupo CoAI, la Universidad de Tsinghua y Microsoft Research propusieron una teoría para optimizar el aprendizaje LM para maximizar la relación de compresión. Derivan el teorema de la Ley del Aprendizaje, lo que confirma que todos los ejemplos contribuyen por igual al aprendizaje óptimo, validado en experimentos. El proceso óptimo mejora los coeficientes de la ley de escala LM, guiando los métodos de aceleración futuros.


Revisar la Papel y GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y noticias de Google. Unirse nuestro SubReddit de 38k+ ML, 41k+ comunidad de Facebook, Canal de discordiay LinkedIn Grarriba.

Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..

No olvides unirte a nuestro Canal de telegramas

También te puede gustar nuestro Cursos GRATUITOS de IA….


Asjad es consultor interno en Marktechpost. Está cursando B.Tech en ingeniería mecánica en el Instituto Indio de Tecnología, Kharagpur. Asjad es un entusiasta del aprendizaje automático y el aprendizaje profundo que siempre está investigando las aplicaciones del aprendizaje automático en la atención médica.