LinkedIn ha presentado recientemente su revolucionaria innovación: la Kernel Liger (tiempo de ejecución eficiente de GPU de LinkedIn)una colección de núcleos Triton altamente eficientes diseñados específicamente para el entrenamiento de modelos de lenguaje grandes (LLM). Esta nueva tecnología representa un avance en el aprendizaje automático, en particular en el entrenamiento de modelos a gran escala que requieren recursos computacionales sustanciales. El núcleo Liger está listo para convertirse en una herramienta fundamental para investigadores, profesionales del aprendizaje automático y aquellos ansiosos por optimizar la eficiencia del entrenamiento de su GPU.
Introducción al kernel de Liger
El kernel de Liger ha sido diseñado meticulosamente para abordar las crecientes demandas de la formación LLM mejorando tanto la velocidad como la eficiencia de la memoria. El equipo de desarrollo de LinkedIn ha implementado varias funciones avanzadas en el kernel de Liger, entre ellas, Hugging Face-compatible RMSNorm, RoPE, SwiGLU, CrossEntropy, FusedLinearCrossEntropy y más. Estos kernels son eficientes y compatibles con herramientas ampliamente utilizadas como Flash Attention, PyTorch FSDP y Microsoft DeepSpeed, lo que los hace muy versátiles para diversas aplicaciones.
Principales características y beneficios
Uno de los aspectos más destacables del kernel Liger es su capacidad de aumentar el rendimiento del entrenamiento multi-GPU en más del 20%, al tiempo que reduce el uso de memoria hasta en un 60%. Este doble beneficio se logra mediante la fusión del kernel, el reemplazo en el lugar y las técnicas de fragmentación que optimizan los procesos computacionales involucrados en el entrenamiento LLM. El kernel está diseñado para ser liviano, con dependencias mínimas, y requiere solo Torch y Triton, lo que elimina los dolores de cabeza comunes asociados con la gestión de dependencias de software complejas.
La eficiencia del kernel Liger se ejemplifica aún más con su capacidad para manejar longitudes de contexto más grandes, tamaños de lotes más grandes y vocabularios masivos sin comprometer el rendimiento. Por ejemplo, mientras que los modelos Hugging Face tradicionales pueden encontrar errores de falta de memoria (OOM) a 4K, el kernel Liger puede escalar hasta 16K, lo que aumenta sustancialmente la capacidad y la capacidad del modelo.
Aplicaciones y casos de uso
El kernel Liger es particularmente beneficioso para quienes trabajan en proyectos de capacitación LLM a gran escala. Por ejemplo, al entrenar el modelo LLaMA 3-8B, el kernel Liger puede lograr hasta un 20 % de aumento en la velocidad de entrenamiento y una reducción del 40 % en el uso de memoria. Esto es especialmente útil para el entrenamiento en conjuntos de datos como Alpaca, donde la eficiencia computacional puede afectar significativamente el costo general y el tiempo requerido para el desarrollo del modelo.
En escenarios más avanzados, como la fase de reentrenamiento de un LLM de múltiples cabezales como Medusa, el kernel Liger puede reducir el uso de memoria en un impresionante 80% y, al mismo tiempo, mejorar el rendimiento en un 40%. Estas mejoras son cruciales para los investigadores y profesionales que buscan ampliar los límites de lo que es posible con los LLM, lo que les permite experimentar con modelos más grandes y arquitecturas más complejas sin limitaciones de hardware.
Descripción técnica
El kernel de Liger integra varias operaciones clave basadas en Triton que mejoran el rendimiento del entrenamiento LLM. Entre ellas se encuentran RMSNorm, RoPE, SwiGLU y FusedLinearCrossEntropy, cada una de las cuales contribuye a la eficiencia general del kernel. Por ejemplo, RMSNorm normaliza las activaciones utilizando su raíz cuadrada media. Este proceso se ha optimizado dentro del kernel de Liger para lograr un aumento de tres veces en la velocidad y la reducción de la memoria máxima.
De manera similar, RoPE (Rotary Positional Embedding) y SwiGLU (Swish Gated Linear Units) se han implementado con técnicas de reemplazo in situ que reducen significativamente el uso de memoria y aumentan la velocidad computacional. La función de pérdida CrossEntropy, fundamental para muchas tareas LLM, también se ha optimizado para reducir el uso máximo de memoria en más de cuatro veces y duplicar la velocidad de ejecución.
Facilidad de uso e instalación
A pesar de sus capacidades avanzadas, el kernel de Liger está diseñado para ser fácil de usar y de integrar en flujos de trabajo existentes. Los usuarios pueden aplicar parches a sus modelos Hugging Face existentes con los kernels de Liger optimizados utilizando solo una línea de código. El diseño liviano del kernel también garantiza que sea compatible con configuraciones de múltiples GPU, incluidas PyTorch FSDP y DeepSpeed, sin requerir una configuración extensa ni bibliotecas adicionales.
El kernel de Liger se puede instalar a través de pip, y hay versiones estables y nocturnas disponibles. Esta facilidad de instalación, combinada con las dependencias mínimas del kernel, lo hace accesible a una amplia gama de usuarios, desde expertos en aprendizaje automático hasta novatos curiosos que buscan mejorar la eficiencia de su entrenamiento.
Perspectivas de futuro y participación comunitaria
LinkedIn se compromete a mejorar continuamente el Liger Kernel y agradece las contribuciones de la comunidad. Al fomentar la colaboración, LinkedIn tiene como objetivo reunir los mejores kernels para la formación LLM e incorporarlos en futuras versiones del Liger Kernel. Este enfoque garantiza que el kernel se mantenga a la vanguardia de la innovación tecnológica en la formación LLM.
Conclusión
El lanzamiento del Liger Kernel por parte de LinkedIn marca un hito importante en la evolución del entrenamiento de modelos a gran escala. El Liger Kernel se convertirá en una herramienta indispensable para cualquier persona involucrada en el entrenamiento de modelos a gran escala, al ofrecer una solución altamente eficiente, fácil de usar y versátil. Su capacidad para mejorar drásticamente tanto la velocidad como la eficiencia de la memoria acelerará sin duda el desarrollo de modelos a gran escala más avanzados y capaces, allanando el camino para avances en inteligencia artificial.
Echa un vistazo a la GitHub. Todo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa..
No olvides unirte a nuestro Más de 49 000 suscriptores de ML en Reddit
Encuentra lo próximo Seminarios web sobre IA aquí
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc. Como ingeniero y emprendedor visionario, Asif está comprometido con aprovechar el potencial de la inteligencia artificial para el bien social. Su iniciativa más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad de noticias sobre aprendizaje automático y aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.