NVIDIA AI lanza Nemotron 3: una pila MoE híbrida de Mamba Transformer para IA agente de contexto prolongado

NVIDIA ha lanzado la familia Nemotron 3 de modelos abiertos como parte de una pila completa para IA agente, que incluye pesos de modelos, conjuntos de datos y herramientas de aprendizaje por refuerzo. La familia tiene tres tamaños, Nano, Super y Ultra, y se dirige a sistemas multiagente que necesitan un razonamiento contextual prolongado con un control estricto sobre el costo de inferencia. Nano tiene alrededor de 30 mil millones de parámetros con alrededor de 3 mil millones activos por token, Super tiene alrededor de 100 mil millones de parámetros con hasta 10 mil millones activos por token y Ultra tiene alrededor de 500 mil millones de parámetros con hasta 50 mil millones activos por token.

https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Nano-Technical-Report.pdf

Familia de modelos y cargas de trabajo objetivo

Nemotron 3 se presenta como una familia de modelos abiertos eficientes para aplicaciones agentes. La línea consta de modelos Nano, Super y Ultra, cada uno de ellos adaptado a diferentes perfiles de carga de trabajo.

Nemotron 3 Nano es un modelo de lenguaje híbrido Mamba Transformer de Mixture of Experts con aproximadamente 31,6 mil millones de parámetros. Sólo unos 3.200 millones de parámetros están activos por paso directo, o 3.600 millones incluidas las incrustaciones. Esta activación escasa permite que el modelo mantenga una alta capacidad de representación mientras mantiene la computación baja.

Nemotron 3 Super tiene alrededor de 100 mil millones de parámetros con hasta 10 mil millones activos por token. Nemotron 3 Ultra escala este diseño a aproximadamente 500 mil millones de parámetros con hasta 50 mil millones activos por token. Super apunta al razonamiento de alta precisión para grandes aplicaciones de múltiples agentes, mientras que Ultra está diseñado para flujos de trabajo complejos de investigación y planificación.

Nemotron 3 Nano ya está disponible con pesas y recetas abiertas, en Hugging Face y como microservicio NVIDIA NIM. Super y Ultra están programados para el primer semestre de 2026.

NVIDIA Nemotron 3 Nano ofrece un rendimiento de tokens aproximadamente 4 veces mayor que Nemotron 2 Nano y reduce significativamente el uso de tokens de razonamiento, al tiempo que admite una longitud de contexto nativo de hasta 1 millón de tokens. Esta combinación está destinada a sistemas multiagente que operan en grandes espacios de trabajo, como documentos extensos y bases de código grandes.

https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Nano-Technical-Report.pdf

Arquitectura híbrida Mamba Transformer MoE

El diseño central de Nemotron 3 es una arquitectura híbrida Mamba Transformer de una mezcla de expertos. Los modelos mezclan bloques de secuencia Mamba, bloques de atención y bloques expertos dispersos dentro de una sola pila.

Para Nemotron 3 Nano, el equipo de investigación describe un patrón que entrelaza bloques de Mamba 2, bloques de atención y bloques de MoE. Las capas de avance estándar de generaciones anteriores de Nemotron se reemplazan por capas MoE. Un enrutador aprendido selecciona un pequeño subconjunto de expertos por token, por ejemplo, 6 de 128 expertos enrutables para Nano, lo que mantiene el recuento de parámetros activos cerca de 3,2 mil millones, mientras que el modelo completo contiene 31,6 mil millones de parámetros.

https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Nano-Technical-Report.pdf

Mamba 2 maneja el modelado de secuencias de largo alcance con actualizaciones de estilo de espacio de estado, las capas de atención brindan interacciones directas de token a token para tareas sensibles a la estructura y MoE proporciona escalamiento de parámetros sin escalamiento de cálculo proporcional. El punto importante es que la mayoría de las capas son secuencias rápidas o cálculos expertos dispersos, y la atención total se utiliza sólo donde más importa para el razonamiento.

Para Nemotron 3 Super y Ultra, NVIDIA agrega LatentMoE. Los tokens se proyectan en un espacio latente de dimensiones inferiores, los expertos operan en ese espacio latente y luego los resultados se proyectan hacia atrás. Este diseño permite varias veces más expertos con costos de comunicación y computación similares, lo que respalda una mayor especialización en tareas e idiomas.

Super y Ultra también incluyen predicción de múltiples tokens. Múltiples cabezales de salida comparten un tronco común y predicen varios tokens futuros en una sola pasada. Durante el entrenamiento, esto mejora la optimización y, en la inferencia, permite la decodificación especulativa, como la ejecución, con menos pases completos hacia adelante.

Datos de entrenamiento, formato de precisión y ventana de contexto.

Nemotron 3 está entrenado con texto y datos de código a gran escala. El equipo de investigación informa sobre un entrenamiento previo de alrededor de 25 billones de tokens, con más de 3 billones de nuevos tokens únicos durante la generación Nemotron 2. Nemotron 3 Nano utiliza Nemotron Common Crawl v2 punto 1, Nemotron CC Code y Nemotron Pretraining Code v2, además de conjuntos de datos especializados para contenido científico y de razonamiento.

Super y Ultra están entrenados principalmente en NVFP4, un formato de punto flotante de 4 bits optimizado para aceleradores NVIDIA. Las operaciones de multiplicación de matrices se ejecutan en NVFP4, mientras que las acumulaciones utilizan mayor precisión. Esto reduce la presión de la memoria y mejora el rendimiento manteniendo la precisión cerca de los formatos estándar.

Todos los modelos Nemotron 3 admiten ventanas contextuales de hasta 1 millón de tokens. La arquitectura y el proceso de capacitación están ajustados para un razonamiento de largo plazo en esta longitud, lo cual es esencial para entornos de múltiples agentes que pasan grandes rastros y memoria de trabajo compartida entre agentes.

Conclusiones clave

Nemotron 3 es una familia de modelos abiertos de tres niveles para IA agente: Nemotron 3 viene en variantes Nano, Super y Ultra. Nano tiene alrededor de 30 mil millones de parámetros con alrededor de 3 mil millones activos por token, Super tiene alrededor de 100 mil millones de parámetros con hasta 10 mil millones activos por token y Ultra tiene alrededor de 500 mil millones de parámetros con hasta 50 mil millones activos por token. La familia se dirige a aplicaciones de múltiples agentes que necesitan un razonamiento de contexto largo y eficiente. MoE híbrido Mamba Transformer con contexto de 1 millón de tokens: los modelos Nemotron 3 utilizan una arquitectura híbrida Mamba 2 plus Transformer con una mezcla escasa de expertos y admiten una ventana de contexto de 1 millón de tokens. Este diseño brinda un manejo de contexto prolongado con alto rendimiento, donde solo un pequeño subconjunto de expertos está activo por token y la atención se utiliza donde es más útil para el razonamiento. MoE latente y predicción de múltiples tokens en Super y Ultra: las variantes Super y Ultra agregan MoE latente donde el cálculo experto ocurre en un espacio latente reducido, lo que reduce el costo de comunicación y permite más expertos y cabezas de predicción de múltiples tokens que generan varios tokens futuros por paso hacia adelante. Estos cambios mejoran la calidad y permiten acelerar el estilo especulativo para textos largos y cargas de trabajo de cadenas de pensamiento. Datos de entrenamiento a gran escala y precisión NVFP4 para mayor eficiencia: Nemotron 3 está preentrenado en aproximadamente 25 billones de tokens, con más de 3 billones de tokens nuevos respecto a la generación anterior, y Super y Ultra están entrenados principalmente en NVFP4, un formato de punto flotante de 4 bits para GPU NVIDIA. Esta combinación mejora el rendimiento y reduce el uso de memoria mientras mantiene la precisión cercana a la precisión estándar.

Consulte el artículo, el blog técnico y los pesos de los modelos en HF. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.