NVIDIA AI lanza Nemotron 3 Ultra: un transformador Mamba híbrido abierto 550B de mezcla de expertos para agentes de larga duración

NVIDIA ha lanzado Nemotron 3 Ultra, el modelo más grande de su familia Nemotron 3. Se dirige a un problema específico: agentes de larga trayectoria que planifican, utilizan herramientas y razonan en muchos turnos. A medida que los agentes trabajan más tiempo, el número de tokens aumenta y el costo de inferencia aumenta. Nemotron 3 Ultra está diseñado para mantener una alta precisión y al mismo tiempo hacer que la inferencia sea más rápida y económica.

¿Qué es Nemotrón 3 Ultra?

Nemotron 3 Ultra es un modelo de mezcla de expertos (MoE) de parámetros totales de 550 mil millones. Sólo 55 mil millones de parámetros están activos por token. El diseño MoE mejora la precisión por parámetro activo.

Utiliza una arquitectura híbrida Mamba-Attention en lugar de un Transformer puro. Las capas de Mamba manejan secuencias largas con escala subcuadrática. Se mantienen algunas capas de Atención para una recuperación precisa en contextos grandes.

El modelo fue entrenado previamente con 20 billones de tokens de texto. Luego, el contexto se amplió a 1 millón de tokens. Se capacitó posteriormente utilizando el ajuste fino supervisado (SFT), el aprendizaje por refuerzo (RL) y la destilación de políticas entre múltiples profesores (MOPD).

El equipo de NVIDIA informa un rendimiento de inferencia hasta aproximadamente 6 veces mayor que los LLM abiertos comparables, con una precisión equivalente.

https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf

La Arquitectura

El modelo tiene 108 capas y una dimensión de modelo de 8.192. Utiliza 64 cabezales de consulta y solo 2 cabezales de valor clave, lo que mantiene pequeña la caché de KV. Cada capa del MoE tiene 512 expertos, y los 22 principales se activan por token.

Destacan tres opciones de diseño:

LatentMoE enruta a los expertos de manera más eficiente. Compra más expertos enrutados a un costo de inferencia fijo al intercambiar el ancho de dimensión oculta. El equipo de NVIDIA informa una mayor precisión por parámetro que los MoE granulares estándar. La predicción de múltiples tokens (MTP) predice varios tokens futuros en un solo pase hacia adelante. Permite la decodificación especulativa nativa para una generación más rápida. Dos cabezales MTP comparten parámetros durante el entrenamiento. El preentrenamiento de NVFP4 utiliza el tipo de datos de 4 bits E2M1 con cuantificación de bloques bidimensionales en pesos. El equipo de NVIDIA considera que esta es la demostración a mayor escala de entrenamiento NVFP4 estable y preciso hasta la fecha.

La pila híbrida Mamba-Attention es bastante importante para los agentes. El costo de decodificación por paso de Mamba se mantiene constante a medida que crece la longitud de la secuencia. Es por eso que las ganancias en el rendimiento aumentan en cargas de trabajo largas y con mucha decodificación.

Entrenamiento previo y publicación de datos

El preentrenamiento utilizó un programa de tasa de aprendizaje de Calentamiento-Estable-Decadencia de más de 20 billones de tokens. Se dividió en dos fases. Los primeros 15 billones de tokens están sesgados por la diversidad. Los 5 billones finales están sesgados por datos de alta calidad.

El equipo de NVIDIA también lanzó nuevos conjuntos de datos de preentrenamiento específicos de dominio. Estos incluyen 173 mil millones de tokens de código GitHub actualizados. En una ablación Nemotron 3 Nano, un conjunto legal sintético elevó un promedio legal de LegalBench de 64,6 a 74,7. En una ablación similar, un conjunto de búsqueda de hechos basado en Wiki elevó el proxy SimpleQA de 40,2 a 50,2.

La liberación posterior al entrenamiento también es grande. NVIDIA agrega 10 millones de nuevas muestras SFT y 1 millón de nuevas tareas RL. Agrega 15 nuevos entornos RL. Los totales abiertos acumulados de Nemotron alcanzan 50 millones de muestras SFT, 2 millones de tareas RL y 55 entornos RL.

El entrenamiento no fue del todo fluido. NVIDIA documenta dos divergencias de pérdidas y las trata como un registro de ingeniería útil. El primero, cerca de 8 billones de tokens, se remonta a mover la reducción del gradiente de la capa de salida de FP32 a BF16. La contribución del gradiente MTP se perdió efectivamente en los 7 bits de mantisa de BF16. Volviendo al entrenamiento reestabilizado con reducción de gradiente FP32.

La segunda divergencia, cerca de 16 billones de tokens, no tenía una causa raíz confirmada. NVIDIA lo mitigó ajustando la tasa de aprendizaje tempranamente. Luego redujo el horizonte total de tokens a 20 billones de tokens.

Post-entrenamiento: SFT, RLVR y MOPD

El proceso posterior al entrenamiento ejecuta SFT, luego RLVR unificado, luego calentamiento MOPD, MOPD y MTP Boosting. Todo el ciclo puede repetirse durante varios ciclos.

RLVR significa Aprendizaje por refuerzo con recompensa verificable. Se entrena en muchos entornos a la vez: uso de terminal, ingeniería de software, búsqueda, matemáticas, código, seguridad y más. La recompensa en estos entornos suele ser escasa y depende del entorno.

MOPD es el principal nuevo método post-entrenamiento. El RLVR de entornos mixtos diluye la señal de aprendizaje a medida que crece el número de entornos. Para abordar esto, el equipo de NVIDIA capacitó a más de diez modelos de docentes especializados en dominios. Cada docente tiene su propio plan de formación.

Durante MOPD, el modelo de estudiante genera sus propios despliegues en todos los dominios. Cada implementación es calificada por el maestro correspondiente con una guía densa a nivel de fichas. Esta es una señal más densa que las escasas recompensas de RLVR. El proceso se ejecuta de forma asincrónica, con la generación de lanzamientos, la puntuación de los profesores y las actualizaciones de los estudiantes.

MOPD también es iterativo. Después de un punto de control del MOPD, los nuevos maestros se inicializan a partir del estudiante mejorado. Sus ganancias se fusionan en la siguiente ronda. El equipo de NVIDIA ejecutó dos iteraciones de MOPD para Nemotron 3 Ultra.

Vale la pena señalar una advertencia práctica. MOPD funciona mejor cuando las implementaciones de los estudiantes se mantienen dentro del apoyo del maestro. Un breve calentamiento SFT alinea las dos distribuciones primero. El equipo de NVIDIA descubrió que las ganancias son menores en tareas de razonamiento autónomo que el estudiante rara vez realiza.

Control del esfuerzo de razonamiento

Nemotron 3 Ultra admite tres modos de razonamiento: razonamiento fuera de lugar, regular y esfuerzo medio. Los modos regular y medio también aceptan un control del presupuesto de tiempo de inferencia.

El esfuerzo medio es la palanca de la eficiencia. El equipo de NVIDIA informa que utiliza aproximadamente 2,5 veces menos tokens que el modo normal. El costo es aproximadamente una caída del 7% en la precisión. En el caso de pasos de agentes de gran volumen, ese intercambio puede reducir el gasto de manera significativa.

El caso de referencia

Las comparaciones en el informe de investigación de NVIDIA utilizan GLM-5.1 (754B), Kimi-K2.6 (1T) y Qwen-3.5 (397B), entre otros. El panorama es más competitivo que dominante.

En tareas agentes, Nemotron 3 Ultra publica 90.0 en PinchBench y 56.0 en ProfBench (Buscar). El equipo de NVIDIA reservó ambos como puertas de generalización retenidas y obtuvo solo una puntuación en el modelo final. Obtiene una puntuación de 71,9 en SWE-Bench Verified y 56,4 en Terminal Bench 2.1. En Terminal Bench, Kimi-K2.6 lidera con 67,2.

Razonando, obtiene una puntuación de 570,0 en IOI 2025. El equipo de NVIDIA encuadra esto como una programación competitiva de nivel humano entre los 3 mejores. En AA-Omniscience, registra la puntuación más alta sin alucinaciones del conjunto con 78,7. Eso sugiere una menor tendencia a responder cuando no hay certeza.

El contexto a largo plazo se mantiene a escala. El modelo obtiene una puntuación de 94,7 en RULER con 1 millón de tokens. Varios modelos de comparación más grandes alcanzan un contexto de 256K.

En una configuración de entrada de 8K/salida de 64K en NVFP4 en GB200, Nemotron 3 Ultra alcanza 5,9 veces el rendimiento del GLM-5.1. Es 4,8 veces más rápido que Kimi-K2.6 y 1,6 veces más rápido que Qwen-3.5. Nota: Los números de Nemotron usan TRT-LLM, mientras que los demás usan vLLM.

La compensación es visible en el trabajo pesado previo al llenado. En una configuración de entrada de 50K / salida de 2K, está detrás de Qwen-3.5, porque el costo de precarga rastrea los parámetros activos. El equipo de NVIDIA también informa un costo de finalización de tareas hasta un 30 % menor, gracias a menos tokens por turno en SWE-Bench y Terminal Bench.

El equipo de NVIDIA también hace hincapié en la solidez del arnés. El modelo se entrena con múltiples agentes por tipo de tarea, no con uno solo. Las puntuaciones verificadas por SWE-Bench se mantienen entre el 65% y el 70,4% en Pi, OpenHands, Hermes, OpenCode y Mini SWE Agent. El objetivo es un comportamiento coherente independientemente del marco de implementación.

Cuantización e implementación

El equipo de NVIDIA envía un único punto de control NVFP4. En Blackwell se ejecuta con matemáticas nativas del FP4. En Hopper se ejecuta como W4A16, ya que Hopper carece de núcleos tensores nativos FP4.

La solución final opera a 5,03 bits por elemento. Combina expertos enrutados NVFP4 con capas FP8 para expertos compartidos y lineales Mamba. Las capas de atención permanecen en BF16. El equipo de NVIDIA descubrió que la precisión estaba saturada por debajo de este presupuesto, por lo que una mayor precisión no aportaba ninguna ganancia mensurable.

La huella de peso reducida tiene un beneficio de implementación. La ruta W4A16 deja espacio para colocar pesos MTP en un solo nodo H100 de 8 GPU. Un punto de control del 8PM no podría hacerlo sin abarcar dos nodos.

Conclusiones clave

Nemotron 3 Ultra es un MoE abierto de 550B (55B activo) que utiliza un diseño híbrido Mamba-Attention para agentes de larga duración. NVIDIA informa un rendimiento de inferencia hasta ~6 veces mayor que los LLM abiertos comparables con una precisión equivalente (5,9 veces frente a GLM-5.1 en 8K/64K). Combina un contexto de token de 1M con la puntuación más alta de no alucinaciones en su conjunto de comparación (78,7 en AA-Omniciencia). Centros de poscapacitación sobre Destilación de Políticas de Múltiples Maestros (MOPD), reuniendo más de 10 maestros especializados en un solo estudiante. Los pesos, los datos de entrenamiento y las recetas se envían abiertamente bajo OpenMDW-1.1, con un punto de control NVFP4 para Blackwell, Hopper y Ampere.

Explicador visual de Marktechpost

NVIDIA Nemotrón 3 Ultra

DIAPOSITIVA 1 / 8

Lanzamiento de modelo abierto

Nemotron 3 Ultra: un MoE abierto de 550B diseñado para agentes de larga duración

Un Mamba-Transformer híbrido abierto de mezcla de expertos para razonamiento agente, uso de herramientas y tareas de contexto prolongado.

Totales / Activos

550B/55B

MoE escaso, 55 mil millones activos por token

Contexto

1 millón de fichas

Extendido después del preentrenamiento de 20T tokens

Rendimiento

~6x

Hasta ~6 veces en comparación con LLM abiertos comparables

Licencia

AbiertoMDW-1.1

Pesos abiertos, datos y recetas

Pre-entrenado en tokens 20T, luego post-entrenado con SFT, RLVR y Multi-teacher On-Policy Distillation (MOPD).

¿Qué es?

Un MoE híbrido Mamba-Attention, no un Transformer puro

Pila híbrida: las capas de Mamba escalan subcuadráticamente; Algunas capas de Atención conservan un recuerdo preciso. MoE escaso: 550 B de parámetros totales, 55 B activos por token, lo que mejora la precisión por parámetro activo. Contexto largo: preentrenado en tokens de texto de 20T y luego extendido a una ventana de tokens de 1M. Lanzamiento abierto: puntos de control básicos, posteriores al entrenamiento y NVFP4, además de recetas y datos de entrenamiento.

Las ganancias de rendimiento provienen principalmente del diseño híbrido Mamba-Attention, que limita la huella de caché KV.

Arquitectura

108 capas, 512 expertos por capa, enrutamiento entre los 22 principales

capas

108

Dimensión del modelo 8.192

Atención

64/2

Cabezales de consulta/cabezales KV

Expertos

512

Top-22 activados por token

Precisión

NVFP4

E2M1, cuantificación de bloques 2D

Técnicas clave

LatentMoE: expertos más enrutados a un costo de inferencia fijo mediante el comercio de ancho de dimensión oculta. Predicción de múltiples tokens (MTP): predice varios tokens por pase; Dos cabezas comparten parámetros. Entrenamiento previo de NVFP4: el entrenamiento de FP4 preciso y estable a mayor escala de NVIDIA hasta la fecha.

Entrenamiento previo y datos

Tokens de 20T en dos fases, además de nuevos conjuntos de datos abiertos

Plan de estudios de dos fases: 15T tokens sesgados por la diversidad, luego 5T sesgados por la calidad. Actualización de código: 173 mil millones de nuevos tokens de GitHub con fecha límite del 30 de septiembre de 2025. Datos de dominio (Nano ablaciones): proxy legal levantado LegalBench 64,6 a 74,7; Wiki elevó el proxy SimpleQA 40.2 a 50.2. Datos posteriores al entrenamiento: +10 millones de muestras SFT y +1 millón de tareas RL; los totales alcanzan 50 millones de SFT, 2 millones de tareas RL y 55 entornos.

NVIDIA documenta dos divergencias de pérdidas (cerca de los tokens 8T y 16T) y las correcciones utilizadas para estabilizar el entrenamiento.

Post-entrenamiento

MOPD: reuniendo más de 10 profesores especializados en un solo estudiante

SFT → RLVR → Calentamiento MOPD → MOPD → Impulso MTP

Por qué MOPD: el RLVR de entorno mixto diluye la señal a medida que crece el número de entornos. Cómo funciona: el estudiante genera implementaciones; cada maestro los califica con una guía densa a nivel de fichas. Asíncrono: la generación de lanzamientos, la puntuación de los profesores y las actualizaciones de los estudiantes se ejecutan de forma canalizada. Iterativo: NVIDIA ejecutó dos iteraciones de MOPD, reiniciando a los profesores a partir del estudiante mejorado.

Un breve calentamiento de SFT mantiene los lanzamientos de los estudiantes dentro del apoyo de cada maestro antes de la destilación.

Puntos de referencia

Competitivo en tareas de agente, razonamiento y contexto largo.

PinchBench (retenido)

90.0

Nivel superior de modelos abiertos evaluados

SWE-Bench verificado

71,9

Agentes de ingeniería de software

IIO 2025

570.0

Top-3-nivel humano (encuadre NVIDIA)

REGLA @ 1M

94,7

Recuperación de contexto largo

ProfBench (Búsqueda): 56.0, la segunda puerta de generalización retenida. AA-Omniciencia: puntuación más alta sin alucinaciones en el conjunto con 78,7. Terminal Bench 2.1: 56,4, donde Kimi-K2.6 lidera con 67,2.

Rendimiento y eficiencia

Más rápido en trabajos pesados ​​de decodificación; control presupuestario de costos

frente a GLM-5.1

5,9x

Entrada de 8K/salida de 64K, NVFP4 en GB200

frente a Kimi-K2.6

4,8x

La misma configuración de decodificación intensa

frente a Qwen-3.5

1,6x

Sigue a Qwen en el trabajo pesado de precarga

Costo para completar

~30%

Menor, de menos fichas por turno

Modos de razonamiento: razonamiento apagado, regular y de esfuerzo medio, con control del presupuesto de tiempo de inferencia. Esfuerzo medio: aproximadamente 2,5 veces menos tokens para una caída de precisión de aproximadamente el 7%.

El rendimiento se informa con TRT-LLM para Nemotron y vLLM para los otros modelos.

Cuantización, licencias y conclusiones

Un punto de control NVFP4, en todas las generaciones de GPU NVIDIA

Punto de control único: FP4 nativo en Blackwell, W4A16 en Hopper, también se ejecuta en Ampere. Punto de funcionamiento: 5,03 bits por elemento, mezclando expertos NVFP4 con capas FP8 y BF16. Ganancia en huella: la ruta W4A16 se adapta a los pesos de MTP en un único nodo H100 de 8 GPU. Totalmente abierto: pesos, datos y recetas bajo OpenMDW-1.1; ajuste a través de LoRA, SFT o RL.

No es el máximo goleador en todos los puntos de referencia. El diseño favorece el rendimiento, el contexto prolongado y la confiabilidad para los agentes.

Comisariada por Marktechpost: noticias de desarrollo e investigación de IA/ML para ingenieros y científicos de datos

Fuentes: Informe técnico y blog de NVIDIA Nemotron 3 Ultra · Verificado el 4 de junio de 2026

Dónde utilizar Nemotron 3 Ultra

Consulte el papel, los pesos de los modelos y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros