La necesidad de modelos de lenguaje eficientes en el dispositivo
Los modelos de idiomas grandes se han vuelto integrales para los sistemas de IA, lo que permite tareas como traducción multilingüe, asistencia virtual y razonamiento automatizado a través de arquitecturas basadas en transformadores. Si bien son altamente capaces, estos modelos suelen ser grandes, lo que requiere una poderosa infraestructura de la nube para el entrenamiento e inferencia. Esta confianza conduce a la latencia, los altos costos y las preocupaciones de privacidad, limitando su implementación en dispositivos de borde limitados por recursos. Modelos como GPT y LLAMA, con miles de millones de parámetros, no pueden ejecutarse de manera eficiente en el hardware local debido a su tamaño y la complejidad de sus procesos de entrenamiento e inferencia. Además, su dependencia de conjuntos de datos masivos y GPU de alto rendimiento los hace inadecuados para entornos móviles o integrados. Para superar estos desafíos, existe una creciente necesidad de modelos livianos y eficientes que puedan funcionar bien localmente sin sacrificar el razonamiento y las capacidades de manejo de contexto.
Limitaciones de las soluciones existentes
Se han explorado varios métodos para abordar estos desafíos. Los mecanismos de atención escasa, como la NSA y MOBA, tienen como objetivo reducir el consumo de memoria; Sin embargo, se quedan cortos en la eficiencia de decodificación o introducen una sobrecarga arquitectónica significativa. Para el manejo de datos, los métodos anteriores se han apoyado en el raspado web a gran escala, lo que resulta en corpus ruidosos y no estructurados. Los métodos de filtrado han incluido clasificadores FastText y curación manual, que carecen de profundidad o escalabilidad. Por el lado de la capacitación, se han utilizado marcos como Steplaw para optimizar los hiperparámetros basados en leyes de escala predecibles; Sin embargo, a menudo requieren experimentación extensa y ciclos de GPU, creando una barrera de entrada. Las optimizaciones de inferencia, como la flashatención, reducen la complejidad computacional, pero aún no tienen la entrega de las velocidades requeridas para aplicaciones en tiempo real en dispositivos Edge.
Introducción de MinicPM4: Arquitectura, datos e inferencia eficientes
Investigadores de OpenBMB introdujeron Minicpm4un conjunto de modelos de lenguaje grande altamente eficientes diseñados específicamente para la implementación en el dispositivo. El desarrollo incluye dos variantes: una con 0.5 mil millones de parámetros y otro con 8 mil millones. El modelo se construyó con mejoras en cuatro dimensiones centrales: arquitectura del modelo, datos de capacitación, algoritmo de entrenamiento y sistemas de inferencia. Para la arquitectura, el equipo introdujo Infllm v2un mecanismo de atención escaso que acelera tanto el preflamiento como la decodificación sin sacrificar la comprensión del contexto. En el frente de datos, Ultraclean se empleó para generar y filtrar los conjuntos de datos de capacitación, lo que permite el uso de solo 8 billones de tokens de capacitación en comparación con los 36 billones de modelos competitivos como Qwen3-8 B. Modeltunnel V2 guió el proceso de capacitación con un ajuste eficiente de hiperparameter y CPM.CU manejó la inferencia con la configuración basada en CUDA de la plataforma.
Innovaciones técnicas en minicPM4
La pila tecnológica de MinicPM4 está diseñada para lograr un equilibrio entre el rendimiento y la utilización de recursos. InfllM V2 divide los cachés de valor clave en bloques y selecciona bloques relevantes de Top-K usando núcleos semánticos para su atención, reduciendo el cálculo de atención en un 60% en comparación con la NSA. Su selección de bloque de contexto dinámico y el procesamiento del grupo de consultas a nivel de token le permiten admitir secuencias de hasta 128k tokens mientras se mantiene la velocidad y la coherencia. Ultraclean se basa en una verificación eficiente de datos, utilizando un LLM previamente capacitado y ajuste fino basado en recocido en 10 mil millones de tokens. Esto da como resultado conjuntos de datos de mayor calidad, UltraFineweb en inglés y ultrafineweb-zh en chino, que superan a FineWeb en 3.61 y 1.98 puntos porcentuales, respectivamente, en un rendimiento de referencia promedio. Ultrachat V2 admite admite posterior el entrenamiento mediante la generación de diálogos ricos en razonamiento y múltiples giros.
Rendimiento de referencia y ganancias de velocidad
En términos de rendimiento en bruto, la versión 8B logró puntajes MMLU de 32.24%, superando a FineWeb (28.84%) y FineWeb-EDU (31.80%). En ARC-C y ARC-E, obtuvo 35.67% y 70.62% respectivamente, superando los conjuntos de datos competidores en más de 10 puntos porcentuales. En comparación con QWEN3-8B, MinicPM4 utilizó solo el 22% de los datos de entrenamiento, pero entregó un aumento de 7 veces en la velocidad de inferencia en 128 K de longitud K cuando se probó en GPU del lado final como Jetson AgX Orin y RTX 4090. La velocidad de decodificación promedio de más de 200 tokens/s por insumos a largo plazo, y la arquitectura degradada de la arquitectura degradada a la atención de Densas de Densas. Además, el uso de BITCPM4 permitió la capacitación de cuantización, lo que permite la implementación en dispositivos con restricciones de memoria aún más estrictas sin perder la fidelidad de rendimiento.
Control de llave de MinicPM4:
- MinicPM4 viene en tamaños de parámetros 0.5B y 8B, optimizado para dispositivos de borde.
- Utilizó solo 8 billones de tokens de entrenamiento, versus 36 billones por Qwen3-8 B.
- Logró un procesamiento 7x más rápido de 128 documentos de longitud K en comparación con QWen3-8 B.
- INFLLM V2 redujo los costos de cálculo de atención en un 60% utilizando atención a nivel de bloque.
- UltraFineweb superó a FineWeb en un 3,61% (inglés) y 1.98% (chino) en puntos de referencia.
- Alcanzó el 35,67% en ARC-C, 70.62% en ARC-E y 32.24% en MMLU, excediendo conjuntos de datos anteriores.
- BITCPM4 habilitó Ternary LLMS adecuado para hardware extremadamente restringido.
- Sistema de inferencia CPM.CU Optimización CUDA combinada con muestreo especulativo.
- Ultrachat V2 habilitó el ajuste mejorado con generación de diálogo intensivo de razonamiento.
- Modeltunnel V2 usó escala escala para un ajuste preciso de hiperparameter, aumentando la eficiencia de entrenamiento.
CONCLUSIÓN: LLMS eficiente para aplicaciones EDGE AI
En conclusión, el enfoque integral adoptado por el equipo de MinicPM4 abordó todas las ineficiencias clave asociadas con los LLM actuales. Al introducir nuevas estrategias arquitectónicas, de capacitación y despliegue, el modelo mantiene respuestas de alta calidad, admite la comprensión de contexto a largo plazo y funciona bien bajo limitaciones de borde. El éxito de este trabajo se extiende más allá de las métricas en bruto para demostrar que el rendimiento de vanguardia se puede lograr fuera de la nube. Permite nuevos dominios de aplicación, como asistentes seguros fuera de línea, IA móvil en tiempo real y sistemas integrados autónomos, sin la carga computacional tradicional.
Mira el Papel, Modelo en la cara abrazada y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.