Los avances en el aprendizaje profundo han influido en una amplia variedad de aplicaciones científicas e industriales de la inteligencia artificial. El procesamiento del lenguaje natural, la IA conversacional, el análisis de series temporales y los formatos secuenciales indirectos (como imágenes y gráficos) son ejemplos comunes de los complicados trabajos de procesamiento de datos secuenciales involucrados en estos. Las redes neuronales recurrentes (RNN) y los transformadores son los métodos más comunes; cada uno tiene ventajas y desventajas. Los RNN tienen menores requisitos de memoria, especialmente cuando se trata de secuencias largas. Sin embargo, no pueden escalar debido a problemas como el problema del gradiente evanescente y la falta de paralelización relacionada con el entrenamiento en la dimensión temporal.
Como sustituto eficaz, los transformadores pueden manejar dependencias a corto y largo plazo y permitir el entrenamiento en paralelo. En el procesamiento del lenguaje natural, modelos como GPT-3, ChatGPT LLaMA y Chinchilla demuestran el poder de Transformers. Con su complejidad cuadrática, el mecanismo de autoatención es costoso desde el punto de vista computacional y de memoria, lo que lo hace inadecuado para tareas con recursos limitados y secuencias largas.
Un grupo de investigadores abordó estos problemas introduciendo el modelo de valor clave ponderado por aceptación (RWKV), que combina las mejores características de RNN y Transformers evitando sus principales deficiencias. Al tiempo que preserva las cualidades expresivas de Transformer, como el entrenamiento en paralelo y una escalabilidad sólida, RWKV elimina los cuellos de botella de memoria y el escalado cuadrático que son comunes en Transformers. Lo hace con un escalado lineal eficiente.
El estudio ha sido realizado por Generative AI Commons, Eleuther AI, U. de Barcelona, Charm Therapeutics, Ohio State U., U. of C., Santa Barbara, Zendesk, Booz Allen Hamilton, Tsinghua University, Peking University, Storyteller.io , Crisis, U. de Nueva York, U. Nacional de Singapur, U. de Ciencia y Tecnología de Wroclaw, Databaker Technology, U. Purdue, Criteo AI Lab, Epita, Nextremer, U. Yale, RuoxinTech, U. de Oslo, U. de Ciencia y Tecnología de China, Kuaishou Technology, U. de Columbia Británica, U. de C., Santa Cruz, U. de Ciencia y Tecnología Electrónica de China.
Al reemplazar la ineficiente interacción del token del producto punto con la atención más eficiente dirigida al canal, RWKV reelabora el mecanismo de atención utilizando una variante de atención lineal. La complejidad computacional y de memoria es más baja en este enfoque, que no utiliza aproximación.
Al reelaborar la recurrencia y los sesgos inductivos secuenciales para permitir una paralelización de entrenamiento eficiente y una inferencia eficiente, reemplazando la atención QK cuadrática con una formulación escalar a un costo lineal y mejorando la dinámica de entrenamiento usando inicializaciones personalizadas, RWKV puede abordar las limitaciones de las arquitecturas actuales mientras captura la localidad. y dependencias de largo alcance.
Al comparar la arquitectura sugerida con SoTA, los investigadores descubren que funciona de manera similar y al mismo tiempo es más rentable en una variedad de cargas de trabajo de procesamiento del lenguaje natural (NLP). Pruebas adicionales de interpretabilidad, escala y expresividad resaltan las fortalezas del modelo y revelan similitudes de comportamiento entre RWKV y otros LLM. Para que estructuras eficientes y escalables modelen relaciones complicadas en datos secuenciales, RWKV proporciona un nuevo camino. A pesar de que numerosas alternativas de Transformers hacen afirmaciones similares, esta es la primera en utilizar modelos previamente entrenados con decenas de miles de millones de parámetros para respaldar dichas afirmaciones.
El equipo destaca algunas de las limitaciones de su trabajo. Antes que nada, la atención lineal de RWKV conduce a enormes mejoras en la eficiencia, pero también podría obstaculizar la capacidad del modelo para recordar detalles finos durante largos períodos. Esto se debe a que, a diferencia de los Transformers ordinarios, que mantienen toda la información mediante atención cuadrática, este solo utiliza una representación vectorial a lo largo de varios pasos de tiempo.
El trabajo también tiene el inconveniente de poner más énfasis en la ingeniería rápida que los modelos de transformadores convencionales. Específicamente, el mecanismo de atención lineal de RWKV restringe la cantidad de datos relacionados con las indicaciones que pueden transportarse a la iteración posterior del modelo. Por lo tanto, es probable que las señales bien diseñadas sean mucho más importantes para que el modelo tenga un buen desempeño en las tareas.
Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 34k+ ML, 41k+ comunidad de Facebook, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.
Si te gusta nuestro trabajo, te encantará nuestra newsletter.
Dhanshree Shenwai es ingeniero en informática y tiene una buena experiencia en empresas de tecnología financiera que cubren el ámbito financiero, tarjetas y pagos y banca con un gran interés en las aplicaciones de IA. Le entusiasma explorar nuevas tecnologías y avances en el mundo en evolución de hoy que facilita la vida de todos.