Los LLM se destacan en tareas de procesamiento de lenguaje natural, pero enfrentan desafíos de implementación debido a las altas demandas computacionales y de memoria durante la inferencia. Investigaciones recientes [MWM+24, WMD+23, SXZ+24, XGZC23, LKM23] El objetivo es mejorar la eficiencia de LLM a través de la cuantificación, la poda, la destilación y la decodificación mejorada. La escasez, un enfoque clave, reduce el cálculo al omitir elementos cero y disminuye la transferencia de E/S entre la memoria y las unidades de cálculo. Si bien la escasez de peso ahorra cálculo, tiene problemas con la paralelización de la GPU y la pérdida de precisión. La escasez de activación, lograda a través de técnicas como el mecanismo de mezcla de expertos (MoE), también necesita una eficiencia total y requiere un estudio adicional sobre las leyes de escala en comparación con los modelos densos.
Investigadores de Microsoft y la Universidad de la Academia de Ciencias de China han desarrollado Q-Sparse, un método eficiente para entrenar LLM escasamente activados. Q-Sparse permite una dispersión de activación completa al aplicar la dispersión top-K a las activaciones y usar un estimador directo durante el entrenamiento, lo que mejora significativamente la eficiencia de la inferencia. Los hallazgos clave incluyen lograr un rendimiento de LLM de referencia con menores costos de inferencia, establecer una ley de escalamiento óptima para LLM escasamente activados y demostrar efectividad en varios entornos de entrenamiento. Q-Sparse funciona con modelos de precisión completa y de 1 bit, lo que ofrece un camino hacia LLM más eficientes, rentables y que ahorran energía.
Q-Sparse mejora la arquitectura del transformador al permitir una dispersión total en las activaciones a través de la dispersión top-K y el estimador directo (STE). Este enfoque aplica una función top-K a las activaciones durante la multiplicación de matrices, lo que reduce los costos computacionales y el uso de memoria. Admite modelos cuantizados y de precisión total, incluidos modelos de 1 bit como BitNet b1.58. Además, Q-Sparse utiliza ReLU al cuadrado para capas de avance para mejorar la dispersión de la activación. Para el entrenamiento, supera la desaparición del gradiente mediante el uso de STE. Q-Sparse es eficaz para el entrenamiento desde cero, el entrenamiento continuo y el ajuste fino, manteniendo la eficiencia y el rendimiento en varias configuraciones.
Estudios recientes muestran que el rendimiento de los LLM se escala con el tamaño del modelo y los datos de entrenamiento siguiendo una ley de potencia. Los investigadores exploran esto para los LLM escasamente activados, y encuentran que su rendimiento también sigue una ley de potencia con el tamaño del modelo y un estatuto exponencial con la razón de escasez. Los experimentos revelan que, con una razón de escasez fija, las escalas de rendimiento de los modelos escasamente activados son similares a las de los modelos densos. La brecha de rendimiento entre los modelos dispersos y densos disminuye con el aumento del tamaño del modelo. Una ley de escala óptima para la inferencia indica que los modelos dispersos pueden igualar o superar de manera eficiente a los modelos densos con la escasez adecuada, con razones de escasez óptimas del 45,58 % para precisión total y del 61,25 % para modelos de 1,58 bits.
Los investigadores evaluaron los LLM de Q-Sparse en varios entornos, incluido el entrenamiento desde cero, el entrenamiento continuo y el ajuste fino. Al entrenar desde cero con tokens 50B, Q-Sparse coincidió con las líneas base densas con un 40 % de escasez. Los modelos BitNet b1.58 con Q-Sparse superaron a las líneas base densas con el mismo presupuesto de cómputo. El entrenamiento continuo de Mistral 7B mostró que Q-Sparse logró un rendimiento comparable al de las líneas base densas, pero con mayor eficiencia. Los resultados del ajuste fino demostraron que los modelos Q-Sparse con alrededor de 4B de parámetros activados coincidieron o superaron el rendimiento de los modelos 7B densos, lo que demuestra la eficiencia y la eficacia de Q-Sparse en todos los escenarios de entrenamiento.
En conclusión, los resultados muestran que la combinación de BitNet b1.58 con Q-Sparse ofrece importantes ganancias de eficiencia, particularmente en inferencia. Los investigadores planean ampliar la capacitación con más tamaños de modelos y tokens e integrar YOCO para optimizar la administración de caché KV. Q-Sparse complementa a MoE y se adaptará para el procesamiento por lotes para mejorar su practicidad. Q-Sparse tiene un rendimiento comparable al de las líneas base densas, mejorando la eficiencia de la inferencia a través de la esparsificación top-K y el estimador directo. Es eficaz en varias configuraciones y compatible con modelos de precisión completa y de 1 bit, lo que lo convierte en un enfoque fundamental para mejorar la eficiencia y la sostenibilidad de LLM.
Revisar la Papel. Todo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo.
Únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro Subreddit de más de 46 000 millones de usuarios
Sana Hassan, pasante de consultoría en Marktechpost y estudiante de doble titulación en el IIT Madrás, es un apasionado de la aplicación de la tecnología y la IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una perspectiva nueva a la intersección de la IA y las soluciones de la vida real.