NVIDIA ha anunciado el lanzamiento de Nemotron-Cascade 2, un modelo de mezcla de expertos (MoE) 30B de peso abierto con parámetros activados 3B. El modelo se centra en maximizar la “densidad de inteligencia”, ofreciendo capacidades de razonamiento avanzadas en una fracción de la escala de parámetros utilizada por los modelos de frontera. Nemotron-Cascade 2 es el segundo LLM de peso abierto que logra un desempeño de nivel de medalla de oro en la Olimpiada Internacional de Matemáticas (IMO) de 2025, la Olimpiada Internacional de Informática (IOI) y las Finales Mundiales del ICPC.
Desempeño objetivo y compensaciones estratégicas
La propuesta de valor principal de Nemotron-Cascade 2 es su desempeño especializado en razonamiento matemático, codificación, alineación y seguimiento de instrucciones. Si bien logra resultados de vanguardia en estos dominios clave de razonamiento intensivo, seguramente no es una “victoria general” en todos los puntos de referencia.
El rendimiento del modelo sobresale en varias categorías específicas en comparación con el Qwen3.5-35B-A3B lanzado recientemente (febrero de 2026) y el Nemotron-3-Super-120B-A12B más grande:
Razonamiento matemático: supera a Qwen3.5-35B-A3B en AIME 2025 (92,4 frente a 91,9) y HMMT del 25 de febrero (94,6 frente a 89,0). Codificación: Lidera en LiveCodeBench v6 (87,2 frente a 74,6) e IOI 2025 (439,28 frente a 348,6+). Alineación y seguimiento de instrucciones: puntuaciones significativamente más altas en ArenaHard v2 (83,5 frente a 65,4+) e IFBench (82,9 frente a 70,2).
Arquitectura técnica: Cascade RL y destilación basada en políticas multidominio (MOPD)
Las capacidades de razonamiento del modelo surgen de su proceso posterior al entrenamiento, a partir del modelo Nemotron-3-Nano-30B-A3B-Base.
1. Ajuste Supervisado (SFT)
Durante SFT, el equipo de investigación de NVIDIA utilizó un conjunto de datos meticulosamente seleccionado donde las muestras se empaquetaron en secuencias de hasta 256 000 tokens. El conjunto de datos incluía:
1,9 millones de rastros de razonamiento de Python y 1,3 millones de muestras de llamadas de herramientas de Python para codificación competitiva. 816.000 muestras para pruebas matemáticas en lenguaje natural. Una combinación especializada de ingeniería de software (SWE) que consta de 125.000 muestras con agente y 389.000 sin agente.
2. Aprendizaje por refuerzo en cascada
Después de SFT, el modelo se sometió a Cascade RL, que aplica entrenamiento secuencial por dominio. Esto evita un olvido catastrófico al permitir que los hiperparámetros se adapten a dominios específicos sin desestabilizar a otros. El proceso incluye etapas para el seguimiento de instrucciones (IF-RL), RL multidominio, RLHF, RL de contexto largo y código especializado y SWE RL.
3. Destilación multidominio basada en políticas (MOPD)
Una innovación fundamental en Nemotron-Cascade 2 es la integración de MOPD durante el proceso Cascade RL. El ensamblaje MOPD utiliza los modelos ‘maestros’ intermedios de mejor rendimiento, ya derivados de la misma inicialización de SFT, para proporcionar una ventaja de destilación densa a nivel de token. Esta ventaja se define matemáticamente como:
$$a_{t}^{MOPD}=log~\pi^{dominio_{t}}(y_{t}|s_{t})-log~\pi^{tren}(y_{t}|s_{t})$$
El equipo de investigación descubrió que MOPD es sustancialmente más eficiente en cuanto a muestras que los algoritmos de recompensa a nivel de secuencia como la Optimización de políticas relativas al grupo (GRPO). Por ejemplo, en AIME25, MOPD alcanzó un desempeño a nivel docente (92,0) en 30 pasos, mientras que GRPO logró solo 91,0 después de igualar esos pasos.
Características de inferencia e interacción agente
Nemotron-Cascade 2 admite dos modos operativos principales a través de su plantilla de chat:
Modo de pensamiento: iniciado por un solo token, seguido de una nueva línea. Esto activa el razonamiento profundo para tareas complejas de matemáticas y código. Modo sin pensar: se activa anteponiendo un bloque vacío para obtener respuestas más eficientes y directas.
Para tareas de agente, el modelo utiliza un protocolo estructurado de llamada de herramientas dentro del indicador del sistema. Las herramientas disponibles se enumeran dentro de las etiquetas y se le indica al modelo que realice llamadas a herramientas envueltas en etiquetas para garantizar comentarios de ejecución verificables.
Al centrarse en la “densidad de inteligencia”, Nemotron-Cascade 2 demuestra que las capacidades de razonamiento especializado que alguna vez se consideraron dominio exclusivo de los modelos a escala de frontera se pueden lograr a una escala 30B a través del aprendizaje por refuerzo de un dominio específico.
Consulte Papel y modelo en HF. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.