NVIDIA ha lanzado Nemotron 3 Ultra, el modelo más grande de su familia Nemotron 3. Se dirige a un problema específico: agentes de larga trayectoria que planifican, utilizan herramientas y razonan en muchos turnos. A medida que los agentes trabajan más tiempo, el número de tokens aumenta y el costo de inferencia aumenta. Nemotron 3 Ultra está diseñado para mantener una alta precisión y al mismo tiempo hacer que la inferencia sea más rápida y económica.
¿Qué es Nemotrón 3 Ultra?
Nemotron 3 Ultra es un modelo de mezcla de expertos (MoE) de parámetros totales de 550 mil millones. Sólo 55 mil millones de parámetros están activos por token. El diseño MoE mejora la precisión por parámetro activo.
Utiliza una arquitectura híbrida Mamba-Attention en lugar de un Transformer puro. Las capas de Mamba manejan secuencias largas con escala subcuadrática. Se mantienen algunas capas de Atención para una recuperación precisa en contextos grandes.
El modelo fue entrenado previamente con 20 billones de tokens de texto. Luego, el contexto se amplió a 1 millón de tokens. Se capacitó posteriormente utilizando el ajuste fino supervisado (SFT), el aprendizaje por refuerzo (RL) y la destilación de políticas entre múltiples profesores (MOPD).
El equipo de NVIDIA informa un rendimiento de inferencia hasta aproximadamente 6 veces mayor que los LLM abiertos comparables, con una precisión equivalente.
La Arquitectura
El modelo tiene 108 capas y una dimensión de modelo de 8.192. Utiliza 64 cabezales de consulta y solo 2 cabezales de valor clave, lo que mantiene pequeña la caché de KV. Cada capa del MoE tiene 512 expertos, y los 22 principales se activan por token.
Destacan tres opciones de diseño:
LatentMoE enruta a los expertos de manera más eficiente. Compra más expertos enrutados a un costo de inferencia fijo al intercambiar el ancho de dimensión oculta. El equipo de NVIDIA informa una mayor precisión por parámetro que los MoE granulares estándar. La predicción de múltiples tokens (MTP) predice varios tokens futuros en un solo pase hacia adelante. Permite la decodificación especulativa nativa para una generación más rápida. Dos cabezales MTP comparten parámetros durante el entrenamiento. El preentrenamiento de NVFP4 utiliza el tipo de datos de 4 bits E2M1 con cuantificación de bloques bidimensionales en pesos. El equipo de NVIDIA considera que esta es la demostración a mayor escala de entrenamiento NVFP4 estable y preciso hasta la fecha.
La pila híbrida Mamba-Attention es bastante importante para los agentes. El costo de decodificación por paso de Mamba se mantiene constante a medida que crece la longitud de la secuencia. Es por eso que las ganancias en el rendimiento aumentan en cargas de trabajo largas y con mucha decodificación.
Entrenamiento previo y publicación de datos
El preentrenamiento utilizó un programa de tasa de aprendizaje de Calentamiento-Estable-Decadencia de más de 20 billones de tokens. Se dividió en dos fases. Los primeros 15 billones de tokens están sesgados por la diversidad. Los 5 billones finales están sesgados por datos de alta calidad.
El equipo de NVIDIA también lanzó nuevos conjuntos de datos de preentrenamiento específicos de dominio. Estos incluyen 173 mil millones de tokens de código GitHub actualizados. En una ablación Nemotron 3 Nano, un conjunto legal sintético elevó un promedio legal de LegalBench de 64,6 a 74,7. En una ablación similar, un conjunto de búsqueda de hechos basado en Wiki elevó el proxy SimpleQA de 40,2 a 50,2.
La liberación posterior al entrenamiento también es grande. NVIDIA agrega 10 millones de nuevas muestras SFT y 1 millón de nuevas tareas RL. Agrega 15 nuevos entornos RL. Los totales abiertos acumulados de Nemotron alcanzan 50 millones de muestras SFT, 2 millones de tareas RL y 55 entornos RL.
El entrenamiento no fue del todo fluido. NVIDIA documenta dos divergencias de pérdidas y las trata como un registro de ingeniería útil. El primero, cerca de 8 billones de tokens, se remonta a mover la reducción del gradiente de la capa de salida de FP32 a BF16. La contribución del gradiente MTP se perdió efectivamente en los 7 bits de mantisa de BF16. Volviendo al entrenamiento reestabilizado con reducción de gradiente FP32.
La segunda divergencia, cerca de 16 billones de tokens, no tenía una causa raíz confirmada. NVIDIA lo mitigó ajustando la tasa de aprendizaje tempranamente. Luego redujo el horizonte total de tokens a 20 billones de tokens.
Post-entrenamiento: SFT, RLVR y MOPD
El proceso posterior al entrenamiento ejecuta SFT, luego RLVR unificado, luego calentamiento MOPD, MOPD y MTP Boosting. Todo el ciclo puede repetirse durante varios ciclos.
RLVR significa Aprendizaje por refuerzo con recompensa verificable. Se entrena en muchos entornos a la vez: uso de terminal, ingeniería de software, búsqueda, matemáticas, código, seguridad y más. La recompensa en estos entornos suele ser escasa y depende del entorno.
MOPD es el principal nuevo método post-entrenamiento. El RLVR de entornos mixtos diluye la señal de aprendizaje a medida que crece el número de entornos. Para abordar esto, el equipo de NVIDIA capacitó a más de diez modelos de docentes especializados en dominios. Cada docente tiene su propio plan de formación.
Durante MOPD, el modelo de estudiante genera sus propios despliegues en todos los dominios. Cada implementación es calificada por el maestro correspondiente con una guía densa a nivel de fichas. Esta es una señal más densa que las escasas recompensas de RLVR. El proceso se ejecuta de forma asincrónica, con la generación de lanzamientos, la puntuación de los profesores y las actualizaciones de los estudiantes.
MOPD también es iterativo. Después de un punto de control del MOPD, los nuevos maestros se inicializan a partir del estudiante mejorado. Sus ganancias se fusionan en la siguiente ronda. El equipo de NVIDIA ejecutó dos iteraciones de MOPD para Nemotron 3 Ultra.
Vale la pena señalar una advertencia práctica. MOPD funciona mejor cuando las implementaciones de los estudiantes se mantienen dentro del apoyo del maestro. Un breve calentamiento SFT alinea las dos distribuciones primero. El equipo de NVIDIA descubrió que las ganancias son menores en tareas de razonamiento autónomo que el estudiante rara vez realiza.
Control del esfuerzo de razonamiento
Nemotron 3 Ultra admite tres modos de razonamiento: razonamiento fuera de lugar, regular y esfuerzo medio. Los modos regular y medio también aceptan un control del presupuesto de tiempo de inferencia.
El esfuerzo medio es la palanca de la eficiencia. El equipo de NVIDIA informa que utiliza aproximadamente 2,5 veces menos tokens que el modo normal. El costo es aproximadamente una caída del 7% en la precisión. En el caso de pasos de agentes de gran volumen, ese intercambio puede reducir el gasto de manera significativa.
El caso de referencia
Las comparaciones en el informe de investigación de NVIDIA utilizan GLM-5.1 (754B), Kimi-K2.6 (1T) y Qwen-3.5 (397B), entre otros. El panorama es más competitivo que dominante.
En tareas agentes, Nemotron 3 Ultra publica 90.0 en PinchBench y 56.0 en ProfBench (Buscar). El equipo de NVIDIA reservó ambos como puertas de generalización retenidas y obtuvo solo una puntuación en el modelo final. Obtiene una puntuación de 71,9 en SWE-Bench Verified y 56,4 en Terminal Bench 2.1. En Terminal Bench, Kimi-K2.6 lidera con 67,2.
Razonando, obtiene una puntuación de 570,0 en IOI 2025. El equipo de NVIDIA encuadra esto como una programación competitiva de nivel humano entre los 3 mejores. En AA-Omniscience, registra la puntuación más alta sin alucinaciones del conjunto con 78,7. Eso sugiere una menor tendencia a responder cuando no hay certeza.
El contexto a largo plazo se mantiene a escala. El modelo obtiene una puntuación de 94,7 en RULER con 1 millón de tokens. Varios modelos de comparación más grandes alcanzan un contexto de 256K.
En una configuración de entrada de 8K/salida de 64K en NVFP4 en GB200, Nemotron 3 Ultra alcanza 5,9 veces el rendimiento del GLM-5.1. Es 4,8 veces más rápido que Kimi-K2.6 y 1,6 veces más rápido que Qwen-3.5. Nota: Los números de Nemotron usan TRT-LLM, mientras que los demás usan vLLM.
La compensación es visible en el trabajo pesado previo al llenado. En una configuración de entrada de 50K / salida de 2K, está detrás de Qwen-3.5, porque el costo de precarga rastrea los parámetros activos. El equipo de NVIDIA también informa un costo de finalización de tareas hasta un 30 % menor, gracias a menos tokens por turno en SWE-Bench y Terminal Bench.
El equipo de NVIDIA también hace hincapié en la solidez del arnés. El modelo se entrena con múltiples agentes por tipo de tarea, no con uno solo. Las puntuaciones verificadas por SWE-Bench se mantienen entre el 65% y el 70,4% en Pi, OpenHands, Hermes, OpenCode y Mini SWE Agent. El objetivo es un comportamiento coherente independientemente del marco de implementación.
Cuantización e implementación
El equipo de NVIDIA envía un único punto de control NVFP4. En Blackwell se ejecuta con matemáticas nativas del FP4. En Hopper se ejecuta como W4A16, ya que Hopper carece de núcleos tensores nativos FP4.
La solución final opera a 5,03 bits por elemento. Combina expertos enrutados NVFP4 con capas FP8 para expertos compartidos y lineales Mamba. Las capas de atención permanecen en BF16. El equipo de NVIDIA descubrió que la precisión estaba saturada por debajo de este presupuesto, por lo que una mayor precisión no aportaba ninguna ganancia mensurable.
La huella de peso reducida tiene un beneficio de implementación. La ruta W4A16 deja espacio para colocar pesos MTP en un solo nodo H100 de 8 GPU. Un punto de control del 8PM no podría hacerlo sin abarcar dos nodos.
Conclusiones clave
Nemotron 3 Ultra es un MoE abierto de 550B (55B activo) que utiliza un diseño híbrido Mamba-Attention para agentes de larga duración. NVIDIA informa un rendimiento de inferencia hasta ~6 veces mayor que los LLM abiertos comparables con una precisión equivalente (5,9 veces frente a GLM-5.1 en 8K/64K). Combina un contexto de token de 1M con la puntuación más alta de no alucinaciones en su conjunto de comparación (78,7 en AA-Omniciencia). Centros de poscapacitación sobre Destilación de Políticas de Múltiples Maestros (MOPD), reuniendo más de 10 maestros especializados en un solo estudiante. Los pesos, los datos de entrenamiento y las recetas se envían abiertamente bajo OpenMDW-1.1, con un punto de control NVFP4 para Blackwell, Hopper y Ampere.
Explicador visual de Marktechpost
NVIDIA Nemotrón 3 Ultra
DIAPOSITIVA 1 / 8
Comisariada por Marktechpost: noticias de desarrollo e investigación de IA/ML para ingenieros y científicos de datos
Fuentes: Informe técnico y blog de NVIDIA Nemotron 3 Ultra · Verificado el 4 de junio de 2026
Dónde utilizar Nemotron 3 Ultra
Consulte el papel, los pesos de los modelos y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros