Hoy, nos complace anunciar la disponibilidad desde el día cero de NVIDIA Nemotron 3 Ultra en Amazon SageMaker JumpStart.
Con este lanzamiento, ahora puede implementar el modelo Nemotron 3 Ultra mediante una experiencia de implementación con un solo clic. Nemotron 3 Ultra es un modelo abierto creado para el razonamiento y la orquestación de frontera en agentes autónomos de larga duración, que ofrece una inferencia cinco veces más rápida y un costo hasta un 30 % menor para cargas de trabajo de agentes. Nemotron 3 Ultra está optimizado para el formato NVFP4, lo que hace que el modelo sea mucho más rápido y rentable de alojar.
Descripción general de NVIDIA Nemotron 3 Ultra
NVIDIA Nemotron 3 Ultra es un modelo de lenguaje grande abierto con 550 mil millones de parámetros totales y 55 mil millones de parámetros activos. Está construido sobre una arquitectura híbrida Transformer-Mamba Mixture-of-Experts (MoE), diseñada para ofrecer inteligencia de vanguardia a una fracción del costo de cómputo de modelos densos de calidad equivalente.
Detalles de la especificación Arquitectura Híbrido Transformer-Mamba MoE Parámetros 550 B en total / 55 B activo Longitud del contexto Hasta 1 millón de tokens Entrada/Salida Entrada y salida de texto Precisión NVFP4 Velocidad de inferencia 5 veces más rápida para flujos de trabajo de agentes de larga duración Costo Hasta un 30 % menos para tareas complejas de agentes
Por qué la IA agente necesita modelos diseñados específicamente
Los agentes no responden sólo una vez. Planifican, llaman a herramientas, delegan el trabajo a subagentes, verifican los resultados y continúan durante cientos de turnos. Cada paso agrega tokens y cálculos, por lo que las métricas que importan son la finalización de la tarea con una precisión útil, el tiempo de finalización y el costo por tarea.
Nemotron 3 Ultra aborda esto directamente. Su arquitectura MoE activa solo 55 B de sus 550 B de parámetros por paso directo, manteniendo el rendimiento alto incluso en longitudes de contexto de millones de tokens. Esto significa que los agentes pueden mantener ciclos de planificación, llamada de herramientas y autocorrección que abarcan cientos de turnos mientras ayudan a mantener la coherencia y gestionar los costos.
Casos de uso empresarial
Nemotron 3 Ultra destaca en cargas de trabajo que requieren un razonamiento sostenido de varios pasos:
Orquestadores de agentes: coordinan múltiples subagentes, administran el estado a través de largas cadenas de llamadas de herramientas Agentes de codificación: generan, prueban, depuran e iteran código en grandes repositorios Investigación profunda: sintetizan información de múltiples fuentes, mantienen un razonamiento coherente en un contexto extendido Flujos de trabajo empresariales complejos: automatizan procesos de negocios de varios pasos con ramificación de decisiones y recuperación de errores
Comenzando con SageMaker JumpStart
Puede implementar Nemotron 3 Ultra a través de Amazon SageMaker JumpStart con una implementación con un solo clic, eliminando la necesidad de administrar infraestructura o configurar marcos de servicio.
Requisitos previos
Antes de comenzar, asegúrese de tener:
Una cuenta de AWS Permisos con el alcance adecuado para SageMaker JumpStart Cuota de servicio suficiente para instancias de GPU (por ejemplo, ml.p5en.48xlarge, ml.p5.48xlarge o ml.g7e.48xlarge)
Importante: La implementación de este modelo crea un punto final de SageMaker que genera cargos mientras se ejecuta. Las instancias de GPU como ml.p5en.48xlarge pueden costar varios dólares por hora. Consulte los precios de Amazon SageMaker AI para obtener más detalles. Recuerde eliminar su punto final cuando haya terminado para evitar cargos continuos.
Implementar usando SageMaker Studio
Abra Amazon SageMaker Studio En el panel de navegación izquierdo, elija SageMaker JumpStart Busque Nemotron 3 Ultra Seleccione la tarjeta de modelo Elija Implementar Seleccione su tipo de instancia (los tipos de instancia admitidos son ml.p5en.48xlarge, ml.p5.48xlarge o ml.g7e.48xlarge) Revise la configuración de implementación (los valores predeterminados son suficientes para la mayoría de los casos de uso) Elija Implementar para crear el punto final Espere a que el estado del punto final muestre InService antes de continuar hacer inferencia
Implementar usando el SDK de SageMaker Python
Ejecutar inferencia
Limpiar
Para evitar incurrir en cargos innecesarios, elimine el punto final de SageMaker cuando haya terminado:predictor.delete_endpoint()
Conclusión
NVIDIA Nemotron 3 Ultra aporta un razonamiento de vanguardia a Amazon SageMaker JumpStart con una inferencia 5 veces más rápida y hasta un 30 % menos de costo para cargas de trabajo agentes. Su arquitectura híbrida Transformer-Mamba MoE y su ventana de contexto de millones de tokens lo hacen especialmente diseñado para el razonamiento sostenido de varios pasos que exigen los agentes de producción.
Ya sea que esté creando orquestadores de agentes, agentes de codificación, sistemas de investigación profunda o automatización empresarial compleja, Nemotron 3 Ultra está listo para implementarse hoy desde SageMaker JumpStart.
Comience ahora buscando Nemotron 3 Ultra en Amazon SageMaker JumpStart.
Sobre los autores
Dan Ferguson es arquitecto de soluciones en AWS, con sede en Nueva York, EE. UU. Como experto en servicios de aprendizaje automático, Dan trabaja para ayudar a los clientes en su camino hacia la integración de flujos de trabajo de aprendizaje automático de manera eficiente, efectiva y sostenible.
Malav Shastri es ingeniero de desarrollo de software en AWS, donde trabaja en los equipos de Amazon SageMaker JumpStart y Amazon Bedrock. Su función se centra en permitir que los clientes aprovechen los modelos de base patentados y de código abierto de última generación. Malav tiene una maestría en Ciencias de la Computación.
Vivek Gangasani es líder mundial en arquitectura de soluciones, SageMaker Inference. Dirige la arquitectura de soluciones, la comercialización técnica (GTM) y la estrategia de productos salientes para SageMaker Inference. También ayuda a empresas y nuevas empresas a implementar y optimizar modelos GenAI y a crear flujos de trabajo de IA con SageMaker y GPU. Actualmente, se centra en desarrollar estrategias y contenidos para optimizar el rendimiento de la inferencia y casos de uso, como flujos de trabajo Agentic, RAG, etc. En su tiempo libre, Vivek disfruta hacer senderismo, ver películas y probar diferentes cocinas.