Los LLM muestran capacidades impresionantes en numerosas aplicaciones, pero enfrentan desafíos debido a las demandas computacionales y los requisitos de memoria. Este desafío es agudo en escenarios que requieren la implementación local para preocupaciones de privacidad, como procesar registros confidenciales de pacientes o entornos con restricciones de cómputo como sistemas de servicio al cliente en tiempo real y dispositivos de borde. La cuantización posterior al entrenamiento (PTQ) es una solución prometedora que permite una compresión eficiente de modelos previamente capacitados, reduciendo el consumo de memoria en 2-4 veces. Sin embargo, los procesos actuales tienen un cuello de botella con una compresión de 4 bits, con una degradación sustancial del rendimiento al intentar una precisión de 2 o 3 bits. La mayoría de los métodos PTQ se basan en pequeños mini lotes de datos de pre-entrenamiento de uso general para tener en cuenta los cambios de activación resultantes de la cuantización.
Los métodos actuales para la compresión de LLM se dividen principalmente en tres categorías. La cuantización uniforme representa el enfoque más básico, donde los pesos almacenados como tensores flotantes de 16 bits se comprimen tratando cada fila de forma independiente, mapeando flotadores a enteros según los valores máximos y mínimos dentro de cada canal. Las técnicas de cuantización basadas en GPTQ avanzan este concepto centrándose en la reconstrucción de capa, con el objetivo de minimizar la pérdida de reconstrucción después de la cuantización. Además, los métodos de cuantización de precisión mixta ofrecen una estrategia más matizada, que va más allá de la precisión fija para todos los pesos. Estas técnicas asignan el ancho de bits basado en la importancia del peso para mantener el rendimiento, con algunos enfoques que preservan los pesos “atípicos” de alta sensibilidad a mayor precisión.
Investigadores de UNC Chapel Hill han propuesto un nuevo enfoque de cuantización posterior a la capacitación de precisión mixta llamada cuantización de circuito de tareas (TACQ). El método muestra similitudes con el descubrimiento automatizado de circuitos al acondicionar directamente el proceso de cuantización en circuitos de peso específicos, definidos como conjuntos de pesos asociados con el rendimiento de la tarea aguas abajo. TACQ compara los pesos del modelo no cuantizados con los cuantificados uniformemente para estimar los cambios de peso esperados de la cuantización, luego utiliza información de gradiente para predecir los impactos en el rendimiento de la tarea, lo que permite la preservación de los pesos específicos de la tarea. TACQ supera constantemente las líneas de base con los mismos datos de calibración y presupuestos de menor peso, y logra mejoras significativas en los desafiantes regímenes de 2 y 3 bits.
TACQ se define por una métrica de prominencia que identifica pesos críticos para preservar durante la cuantización, basándose en conceptos de la interpretabilidad del modelo como el descubrimiento automático de circuitos, la localización de conocimiento y la atribución de entrada. Esta métrica usa dos componentes:
- Localización consciente de cuantización (QAL): rastree cómo el rendimiento del modelo se ve afectado al estimar los cambios de peso esperados debido a la cuantización.
- Gradiente (MSG) de magnitud: una métrica generalizada para una importancia de peso absoluta adaptada de las técnicas de atribución de entrada.
MSG ayuda a estabilizar TACQ y aborda los sesgos de las estimaciones de Qal. Estos factores se combinan en una métrica de prominencia unificada que puede evaluarse de manera eficiente para cada peso en un solo pase hacia atrás, lo que permite la preservación del P% superior de los pesos de puntuación más altos a una precisión de 16 bits.
En el desafío de 2 bits, TACQ supera a Slim-LLM con mejoras de margen absoluto de 16.0% (de 20.1% a 36.1%) en GSM8K, 14.1% (de 34.8% a 49.2%) en MMLU y 21.9% (de 0% a 21.9%) en Spider. Otros métodos de referencia como GPTQ, Squeezellm y SPQR se deterioran al rendimiento casi aleatorio a este nivel de compresión. A una precisión de 3 bits, TACQ conserva aproximadamente el 91%, el 96% y el 89% de la precisión no cuantizada en GSM8K, MMLU y Spider, respectivamente, al tiempo que supera la línea de base más fuerte, Slim-LLM, por 1-2% en la mayoría de los conjuntos de datos. Las ventajas de TACQ se hacen evidentes en las tareas de generación que requieren salidas de token secuencial, donde es el único método capaz de recuperar un rendimiento no desplegable en la configuración de 2 bits para la tarea de texto de araña a SQL.
En conclusión, los investigadores introdujeron TACQ, un avance significativo en la cuantización posterior al entrenamiento consciente de la tarea. Mejora el rendimiento del modelo a ultra bajos ancho de bits (2 a 3 bits) donde los métodos anteriores se degradan a las salidas cercanas a los aleatorios. TACQ se alinea con la investigación automática de descubrimiento de circuitos al preservar selectivamente solo una pequeña fracción de pesos sobresalientes a una precisión de 16 bits, lo que indica que los “circuitos” de peso escaso influyen desproporcionadamente en tareas específicas. Además, los experimentos en Spider muestran que TACQ conserva mejor las capacidades de generación de modelos, lo que lo hace adecuado para tareas de predicción de programas. Esto también se aplica a situaciones que involucran agentes, donde los modelos generan con frecuencia muchas salidas ejecutables, y donde la eficiencia es una preocupación.
Mira el Papel y Página de Github. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 90k+ ml de subreddit.
Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.
