OpenBMB ha lanzado MiniCPM5-2B, el segundo punto de control de la serie MiniCPM5 y el seguimiento de MiniCPM5-1B. Es un modelo de lenguaje causal denso con 2.516.756.480 parámetros, de los cuales 1.981.982.720 se encuentran fuera de las incrustaciones. Utiliza 42 capas, atención de consultas agrupadas con 16 cabezales de consulta y 2 cabezales de clave/valor, y una ventana de contexto nativa de 131.072 tokens. La arquitectura es LlamaForCausalLM estándar, por lo que los motores convencionales la cargan sin núcleos personalizados ni bifurcación de código modelo.
¿Es desplegable? Sí. Los pesos son Apache 2.0 y se ejecutan en vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX y FlagOS.
Lo que realmente muestra la tabla de referencia
OpenBMB compara MiniCPM5-2B con LFM2.5-2.6B, Qwen3.5-2B y Gemma-4-E2B-it en la misma clase de tamaño, y enumera Qwen3.5-4B, granito-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it y LFM2.5-8B-A1B como referencia. En 34 filas de referencia, tiene un promedio de 53,9. La mejor línea de base en ese conjunto es Qwen3.5-4B con 51.1, luego granito-4.2-3B con 42.7 y LFM2.5-2.6B con 33.2.
En cuanto al razonamiento del código, MiniCPM5-2B publica 69.1 en LiveCodeBench v6 frente a 56.4 y 46.4 en SWE-bench Verified frente a 33.6. El uso de herramientas es el margen más amplio: 97,1 en τ²-Bench Telecom, 66,6 en BFCL v4 y 20,8 en τ³-Bench Banking frente a 6,8. El contexto largo está dividido, con 68,1 en NoLiMa frente a 43,5, pero 59,0 en AA-LCR frente a 61,0 y 43,7 en LongBench v2 frente a 47,3. En el conocimiento general es donde se muestra la diferencia de tamaño: 70,8 en MMLU-Pro frente a 78,0 y 8,9 en Humanity’s Last Exam frente a 9,9. OpenBMB marca las filas procedentes del Análisis Artificial por separado de las reproducidas internamente.
Receta de capacitación: SFT, luego RL, luego destilación basada en políticas
La capacitación sigue el método de gestión de datos por niveles UltraData descrito en la investigación original. El entrenamiento base ejecuta fases estables y de decadencia, luego, a mitad del entrenamiento, adapta el modelo a la distribución de datos objetivo. La capacitación posterior comienza con 400 mil millones de tokens de SFT de pensamiento profundo, luego capacita a profesores de RL especializados en matemáticas, código, tareas de agencia y escritura utilizando el algoritmo JustRL II basado en críticos.
El último paso es la destilación de políticas. OPD fusiona 16 expertos de RL, cinco de ellos agentes, en un único modelo enviado. En cada posición de respuesta, calcula la divergencia KL inversa de vocabulario completo entre los logits de estudiantes y profesores como estimación de ventaja, reemplazando la ventaja basada en verificación. Reutiliza las indicaciones de RL como datos de destilación, por lo que no se crea ningún corpus nuevo. OpenBMB mide la etapa RL más OPD con 10,96 puntos promedio en razonamiento y puntos de referencia generales y 6,96 puntos en análisis agentes.
Los datos también están abiertos.
Además de los pesos, OpenBMB lanzó Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 con 500.000 muestras de agentes y UltraData-RL-2609 con más de 80.000 muestras de RL. También se publican puntos de control intermedios, que cubren únicamente Base, Midtrain y SFT, por lo que la contribución de cada etapa se puede medir directamente.
Resumen
MiniCPM5-2B es una opción creíble en el dispositivo para cargas de trabajo de agentes y llamadas de herramientas, no un modelo de conocimiento general. Su ventaja es más clara en el uso de herramientas, agentes de codificación y recuperación de contexto largo estilo NoLiMa, y va detrás de modelos más grandes en MMLU-Pro, GPQA-Diamond y MATH-500. Los datos abiertos y los puntos de control intermedios hacen que la afirmación de RL más OPD sea verificable, lo que importa más que el promedio general.
Conclusiones clave
Modelo denso de 2,52 B, contexto de 131 072 tokens, Apache 2.0, arquitectura Llama estándar. Promedia 53,9 en 34 puntos de referencia, por delante de Qwen3.5-4B con 51,1. Más fuerte en el uso de herramientas, agentes de codificación y recuperación de contexto prolongado; más débil en conocimiento. Después de la capacitación, se combinan tokens SFT de 400 mil millones con maestros de RL y destilación de políticas. Los conjuntos de datos previos al entrenamiento, SFT y RL se envían junto con las pesas.
Consulte HF, el repositorio de GitHub y la Web. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150kML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
A Sana Hassan, pasante de consultoría en Marktechpost y estudiante de doble titulación en IIT Madras, le apasiona aplicar la tecnología y la inteligencia artificial para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.