Conozca LQ-LoRA: una variante de LoRA que permite la descomposición de matrices cuantificadas de bajo rango para un ajuste eficiente del modelo de lenguaje

En la era de la Inteligencia Artificial que avanza rápidamente, la introducción de los modelos de lenguajes grandes (LLM) ha transformado la forma en que las máquinas y los humanos interactúan entre sí. En los últimos meses se ha visto un aumento exponencial en el número de LLM desarrollados, con capacidades increíbles y algoritmos súper avanzados. Modelos como GPT 3.5, GPT 4, LLaMa, PaLM, etc., han demostrado algunas habilidades excepcionales de imitación humana en comprensión del lenguaje natural (NLU), procesamiento, traducción, resumen e incluso generación de contenido.

Estos LLM están capacitados con cantidades masivas de datos. Sin embargo, surge un desafío cuando estos modelos tienen que adaptarse a nuevos conjuntos de datos. Los investigadores suelen enfrentar problemas al adaptar estos LLM masivos a nuevos conjuntos de datos, ya que el ajuste completo conlleva una serie de gastos y requisitos de memoria. Para abordar la cuestión de la eficiencia de la memoria en el ajuste fino de LLM, recientemente, un equipo de investigadores presentó la idea de métodos de ajuste fino eficientes en los parámetros.

Al aprender una extensión más pequeña y ajustada del modelo original previamente entrenado, estas técnicas pueden reducir la cantidad de memoria necesaria para el ajuste fino. La adaptación de rango bajo (LoRA), que es una estrategia muy popular para una adaptación LLM eficaz, implica volver a parametrizar la matriz de peso del modelo previamente entrenado y ajustar solo dos de sus componentes, es decir, L1 y L2. Los componentes restantes permanecen sin cambios.

Los investigadores han mejorado la eficiencia de la memoria de LoRA aplicándola a un modelo cuantificado previamente entrenado. Para conservar la memoria, la cuantificación disminuye la precisión de los parámetros del modelo y, si la cuantificación es significativa, la inicialización cero puede no ser óptima. Para superar el error de cuantificación, el equipo introdujo una variante de LoRA llamada LQ-LoRA.

LQ-LoRA descompone la matriz de peso en un componente cuantificado, Q, y un componente de rango bajo, L1L2, utilizando una técnica iterativa influenciada por el Análisis de Componentes Principales (PCA). En LQ-LoRa, L1 y L2 se refinan durante la adaptación y se capturan los subespacios de alta varianza de la matriz de peso inicial.

El equipo ha compartido que este trabajo utiliza programación lineal entera para encontrar un método de cuantificación mixto para resolver el problema de aplicar la misma configuración de cuantificación a todas las capas. Dada una tasa de bits global deseada, esta técnica permite asignar varias configuraciones, incluidos bits y tamaño de bloque, a cada matriz.

El equipo ha modificado los modelos RoBERTa y LLaMA-2 de diferentes tamaños, 7B y 70B, utilizando LQ-LoRA. Los hallazgos han demostrado que LQ-LoRA funciona mejor que GPTQ-LoRA y líneas de base sólidas de QLoRA. La capacidad de entrenar un modelo LLaMA-2 de 2,5 bits en el punto de referencia OpenAssistant, que es competitivo con un modelo ajustado con QLoRA de 4 bits, ha demostrado que el enfoque sugerido permite una cuantificación más agresiva.

LQ-LoRA también ha mostrado un gran rendimiento en la compresión de modelos después de ajustarlo en un modelo de lenguaje de calibración de conjuntos de datos. A pesar de la disminución de la tasa de bits, el equipo pudo producir un modelo LLaMA-2-70B de 2,75 bits que es competitivo con el modelo original con total precisión. Esto indica que el método sugerido puede reducir drásticamente las necesidades de memoria de los grandes modelos de lenguaje sin sacrificar la funcionalidad para actividades particulares.

En conclusión, LQ-LoRA supone un importante punto de inflexión en el desarrollo de modelos lingüísticos. Su método de adaptación eficiente de la memoria y consideraciones de reconocimiento de datos, junto con el ajuste dinámico de los parámetros de cuantificación, pueden conducir definitivamente a un cambio de paradigma en el campo de la Inteligencia Artificial.


Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 33k+ ML, 41k+ comunidad de Facebook, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.


Tanya Malhotra es estudiante de último año de la Universidad de Estudios de Petróleo y Energía, Dehradun, y cursa BTech en Ingeniería en Ciencias de la Computación con especialización en Inteligencia Artificial y Aprendizaje Automático.
Es una entusiasta de la Ciencia de Datos con buen pensamiento analítico y crítico, junto con un ardiente interés en adquirir nuevas habilidades, liderar grupos y gestionar el trabajo de manera organizada.