NVIDIA Nemotron 3 Ultra ya disponible en Amazon SageMaker JumpStart

Hoy, nos complace anunciar la disponibilidad desde el día cero de NVIDIA Nemotron 3 Ultra en Amazon SageMaker JumpStart.

Con este lanzamiento, ahora puede implementar el modelo Nemotron 3 Ultra mediante una experiencia de implementación con un solo clic. Nemotron 3 Ultra es un modelo abierto creado para el razonamiento y la orquestación de frontera en agentes autónomos de larga duración, que ofrece una inferencia cinco veces más rápida y un costo hasta un 30 % menor para cargas de trabajo de agentes. Nemotron 3 Ultra está optimizado para el formato NVFP4, lo que hace que el modelo sea mucho más rápido y rentable de alojar.

Descripción general de NVIDIA Nemotron 3 Ultra

NVIDIA Nemotron 3 Ultra es un modelo de lenguaje grande abierto con 550 mil millones de parámetros totales y 55 mil millones de parámetros activos. Está construido sobre una arquitectura híbrida Transformer-Mamba Mixture-of-Experts (MoE), diseñada para ofrecer inteligencia de vanguardia a una fracción del costo de cómputo de modelos densos de calidad equivalente.

Detalles de la especificación Arquitectura Híbrido Transformer-Mamba MoE Parámetros 550 B en total / 55 B activo Longitud del contexto Hasta 1 millón de tokens Entrada/Salida Entrada y salida de texto Precisión NVFP4 Velocidad de inferencia 5 veces más rápida para flujos de trabajo de agentes de larga duración Costo Hasta un 30 % menos para tareas complejas de agentes

Por qué la IA agente necesita modelos diseñados específicamente

Los agentes no responden sólo una vez. Planifican, llaman a herramientas, delegan el trabajo a subagentes, verifican los resultados y continúan durante cientos de turnos. Cada paso agrega tokens y cálculos, por lo que las métricas que importan son la finalización de la tarea con una precisión útil, el tiempo de finalización y el costo por tarea.

Nemotron 3 Ultra aborda esto directamente. Su arquitectura MoE activa solo 55 B de sus 550 B de parámetros por paso directo, manteniendo el rendimiento alto incluso en longitudes de contexto de millones de tokens. Esto significa que los agentes pueden mantener ciclos de planificación, llamada de herramientas y autocorrección que abarcan cientos de turnos mientras ayudan a mantener la coherencia y gestionar los costos.

Casos de uso empresarial

Nemotron 3 Ultra destaca en cargas de trabajo que requieren un razonamiento sostenido de varios pasos:

Orquestadores de agentes: coordinan múltiples subagentes, administran el estado a través de largas cadenas de llamadas de herramientas Agentes de codificación: generan, prueban, depuran e iteran código en grandes repositorios Investigación profunda: sintetizan información de múltiples fuentes, mantienen un razonamiento coherente en un contexto extendido Flujos de trabajo empresariales complejos: automatizan procesos de negocios de varios pasos con ramificación de decisiones y recuperación de errores

Comenzando con SageMaker JumpStart

Puede implementar Nemotron 3 Ultra a través de Amazon SageMaker JumpStart con una implementación con un solo clic, eliminando la necesidad de administrar infraestructura o configurar marcos de servicio.

Requisitos previos

Antes de comenzar, asegúrese de tener:

Una cuenta de AWS Permisos con el alcance adecuado para SageMaker JumpStart Cuota de servicio suficiente para instancias de GPU (por ejemplo, ml.p5en.48xlarge, ml.p5.48xlarge o ml.g7e.48xlarge)

Importante: La implementación de este modelo crea un punto final de SageMaker que genera cargos mientras se ejecuta. Las instancias de GPU como ml.p5en.48xlarge pueden costar varios dólares por hora. Consulte los precios de Amazon SageMaker AI para obtener más detalles. Recuerde eliminar su punto final cuando haya terminado para evitar cargos continuos.

Implementar usando SageMaker Studio

Abra Amazon SageMaker Studio En el panel de navegación izquierdo, elija SageMaker JumpStart Busque Nemotron 3 Ultra Seleccione la tarjeta de modelo Elija Implementar Seleccione su tipo de instancia (los tipos de instancia admitidos son ml.p5en.48xlarge, ml.p5.48xlarge o ml.g7e.48xlarge) Revise la configuración de implementación (los valores predeterminados son suficientes para la mayoría de los casos de uso) Elija Implementar para crear el punto final Espere a que el estado del punto final muestre InService antes de continuar hacer inferencia

Implementar usando el SDK de SageMaker Python

importar sagemaker desde sagemaker.jumpstart.model importar JumpStartModel modelo = JumpStartModel( model_id=”huggingface-reasoning-nvidia-nemotron-3-ultra-550b-a55b-nvfp4″, # Verificar en la tarjeta del modelo JumpStart de SageMaker role=sagemaker.get_execution_role(), # Su función de ejecución de SageMaker ARN) predictor = modelo.deploy(accept_eula=True)

Ejecutar inferencia

carga útil = { “mensajes”: [{
“role”: “user”,
“content”: “Break this task into subtasks, identify which tools are needed, and run them in sequence.”
}]”max_tokens”: 20480, “temperatura”: 0,6, “top_p”: 0,95, } respuesta = predictor.predict(carga útil) print(respuesta[“choices”][0][“message”][“content”])

Limpiar

Para evitar incurrir en cargos innecesarios, elimine el punto final de SageMaker cuando haya terminado:predictor.delete_endpoint()

Conclusión

NVIDIA Nemotron 3 Ultra aporta un razonamiento de vanguardia a Amazon SageMaker JumpStart con una inferencia 5 veces más rápida y hasta un 30 % menos de costo para cargas de trabajo agentes. Su arquitectura híbrida Transformer-Mamba MoE y su ventana de contexto de millones de tokens lo hacen especialmente diseñado para el razonamiento sostenido de varios pasos que exigen los agentes de producción.

Ya sea que esté creando orquestadores de agentes, agentes de codificación, sistemas de investigación profunda o automatización empresarial compleja, Nemotron 3 Ultra está listo para implementarse hoy desde SageMaker JumpStart.

Comience ahora buscando Nemotron 3 Ultra en Amazon SageMaker JumpStart.

Sobre los autores

Dan Ferguson es arquitecto de soluciones en AWS, con sede en Nueva York, EE. UU. Como experto en servicios de aprendizaje automático, Dan trabaja para ayudar a los clientes en su camino hacia la integración de flujos de trabajo de aprendizaje automático de manera eficiente, efectiva y sostenible.

Malav Shastri es ingeniero de desarrollo de software en AWS, donde trabaja en los equipos de Amazon SageMaker JumpStart y Amazon Bedrock. Su función se centra en permitir que los clientes aprovechen los modelos de base patentados y de código abierto de última generación. Malav tiene una maestría en Ciencias de la Computación.

Vivek Gangasani es líder mundial en arquitectura de soluciones, SageMaker Inference. Dirige la arquitectura de soluciones, la comercialización técnica (GTM) y la estrategia de productos salientes para SageMaker Inference. También ayuda a empresas y nuevas empresas a implementar y optimizar modelos GenAI y a crear flujos de trabajo de IA con SageMaker y GPU. Actualmente, se centra en desarrollar estrategias y contenidos para optimizar el rendimiento de la inferencia y casos de uso, como flujos de trabajo Agentic, RAG, etc. En su tiempo libre, Vivek disfruta hacer senderismo, ver películas y probar diferentes cocinas.