Transforme el desarrollo de IA con la personalización del nuevo modelo de IA de Amazon SageMaker y capacidades de capacitación a gran escala

Con el avance de las herramientas y servicios que hacen accesibles los modelos de IA generativa, las empresas ahora pueden acceder a los mismos modelos básicos (FM) que sus competidores. La verdadera diferenciación proviene de la creación de una IA que esté altamente personalizada para su negocio, algo que sus competidores no pueden replicar sin esfuerzo. Aunque los FM de hoy son genuinamente inteligentes con vastos conocimientos y capacidades de razonamiento, la inteligencia sin contexto es meramente potencial. Un modelo sabe cómo pensar, pero no sabe cómo piensa usted, su vocabulario, sus patrones de datos o las limitaciones de su industria.

La creación de modelos que comprendan profundamente su negocio depende de cómo logra que el modelo aprenda de sus datos y preferencias. Los modelos aprenden a través de un proceso paso a paso que refleja el aprendizaje humano: primero adquieren conocimiento general del mundo a través de un entrenamiento previo, luego obtienen conocimiento especializado a través de un ajuste supervisado y finalmente aprenden a alinearse con preferencias específicas a través de técnicas como la optimización de preferencias directas (DPO). En la etapa de inferencia, los modelos pueden aplicar todo lo que han aprendido a tareas del mundo real y pueden continuar adaptándose a través de métodos eficientes en parámetros, como la Adaptación de bajo rango (LoRA), sin volver a entrenar todo el modelo base.

Este viaje de aprendizaje abarca desde la capacitación previa de FM masivos hasta su personalización para casos de uso específicos, y Amazon SageMaker AI ahora brinda capacidades en todo este espectro.

En AWS re:Invent 2025, Amazon SageMaker AI anunció avances significativos que cambian la forma en que las organizaciones pueden abordar la personalización de modelos y la capacitación a gran escala. Las nuevas capacidades abordan dos desafíos persistentes: la complejidad y el tiempo necesarios para personalizar los FM para casos de uso específicos y las costosas fallas de infraestructura que descarrilan semanas de progreso en la capacitación.

Desde el lanzamiento de Amazon SageMaker AI en 2017, nos hemos comprometido a hacer que el desarrollo de IA sea accesible para creadores de diferentes niveles de habilidad. Con más de 450 capacidades introducidas desde su lanzamiento, SageMaker AI continúa eliminando barreras que frenan la innovación. Esta publicación explora cómo las nuevas capacidades de personalización de modelos sin servidor, la capacitación elástica, la capacitación sin puntos de control y el flujo MLflow sin servidor funcionan en conjunto para acelerar el desarrollo de su IA de meses a días.

Personalización del modelo de IA sin servidor con aprendizaje de refuerzo avanzado

La nueva capacidad de personalización de modelos sin servidor en Amazon SageMaker AI transforma lo que tradicionalmente ha sido un proceso de meses en una cuestión de días. Para los desarrolladores de IA que desean el más alto nivel de abstracción, presentamos un flujo de trabajo guiado por agentes de IA (en versión preliminar) que hace que la personalización avanzada del modelo sea accesible a través del lenguaje natural.

En lugar de requerir una gran experiencia en técnicas de aprendizaje por refuerzo, ahora puede describir sus objetivos comerciales en un lenguaje sencillo. El agente de IA participa en una conversación de varios turnos para comprender su caso de uso y luego genera una especificación integral que incluye pautas de conjuntos de datos, criterios de evaluación, métricas asociadas y un modelo recomendado que su equipo puede implementar sin necesidad de conocimientos especializados.

El flujo de trabajo agente de IA admite el ajuste fino supervisado (SFT), la optimización de preferencias directas (DPO), el aprendizaje reforzado a partir de comentarios de IA (RLAIF) y el aprendizaje reforzado a partir de recompensas verificables (RLVR). Los modelos pueden utilizar estas capacidades de aprendizaje por refuerzo para aprender de las preferencias humanas y resultados verificables, creando una IA que se alinee más estrechamente con sus objetivos comerciales. También puede generar datos sintéticos cuando los datos del mundo real son limitados, analizar la calidad de los datos y gestionar la capacitación y la evaluación para garantizar la precisión y los controles responsables de la IA. Este enfoque es completamente sin servidor para eliminar la complejidad de la infraestructura.

Para los desarrolladores de IA que desean tener más control sobre el proceso de personalización, SageMaker AI ofrece una interfaz sencilla con mejores prácticas integradas. A través de SageMaker Studio, puede seleccionar entre modelos populares, incluidos Amazon Nova, Meta's Llama, Qwen, DeepSeek y GPT-OSS, y luego elegir su técnica de personalización preferida.

El flujo de trabajo autoguiado proporciona flexibilidad en cada paso. Puede cargar sus propios conjuntos de datos o seleccionar entre los existentes, configurar hiperparámetros como el tamaño del lote y la tasa de aprendizaje con los valores predeterminados recomendados y elegir entre un ajuste fino eficiente de los parámetros con LoRA o un ajuste fino completo. La interfaz se integra con la capacidad MLflow recientemente introducida para el seguimiento automático de experimentos, lo que le brinda visibilidad del progreso del entrenamiento y el rendimiento del modelo a través de una única interfaz.

Al igual que el enfoque agente de IA, la personalización autoguiada no requiere ningún servidor. SageMaker AI maneja automáticamente el aprovisionamiento, el escalado y la optimización de la computación, para que usted pueda concentrarse en el desarrollo de modelos en lugar de en la administración de la infraestructura. Con el precio de pago por token, puede evitar la sobrecarga de seleccionar tipos de instancias o administrar clústeres.

Colineal AI redujo sus ciclos de experimentación de semanas a días utilizando la capacidad de personalización de modelos sin servidor de SageMaker AI. Soumyadeep Bakshi, cofundador de Collinear AI, dijo:

"En Collinear, creamos conjuntos de datos seleccionados y entornos de simulación para laboratorios de inteligencia artificial de vanguardia y empresas Fortune 500 para mejorar sus modelos. El ajuste de los modelos de inteligencia artificial es fundamental para crear simulaciones de alta fidelidad, y solía requerir unir diferentes sistemas para capacitación, evaluación e implementación. Ahora, con la nueva capacidad de personalización del modelo sin servidor de IA de Amazon SageMaker, tenemos una forma unificada que nos permite reducir nuestros ciclos de experimentación de semanas a días. Esta herramienta sin servidor de extremo a extremo nos ayuda a centrarnos en lo que importa: crear mejores datos de capacitación y simulaciones para nuestros clientes, sin mantener la infraestructura ni hacer malabarismos con plataformas dispares”.

Personalización y preentrenamiento del modelo puente

Si bien la personalización del modelo sin servidor acelera el desarrollo de casos de uso específicos mediante ajustes y refuerzo del aprendizaje, las organizaciones también están expandiendo rápidamente su uso de la IA generativa en muchas partes del negocio. Las aplicaciones que requieren una profunda experiencia en un dominio o un contexto empresarial específico necesitan modelos que realmente comprendan su conocimiento exclusivo, sus flujos de trabajo y sus requisitos únicos. Técnicas como la ingeniería rápida y la generación aumentada de recuperación (RAG) funcionan bien para muchos casos de uso, pero tienen limitaciones fundamentales cuando se trata de incorporar conocimientos especializados en la comprensión central de un modelo. Cuando las organizaciones intentan una personalización más profunda a través de una capacitación previa continua (CPT) utilizando solo sus datos propietarios, a menudo se encuentran con un olvido catastrófico, donde los modelos pierden sus capacidades fundamentales a medida que aprenden contenido nuevo.

Amazon SageMaker AI admite todo el espectro del desarrollo de modelos, desde la personalización sin servidor con aprendizaje de refuerzo avanzado hasta la creación de modelos de frontera desde los primeros puntos de control. Para las organizaciones con datos propietarios que necesitan modelos con una profunda experiencia en el dominio más allá de lo que la personalización por sí sola puede proporcionar, recientemente introdujimos una nueva capacidad que aborda las limitaciones de los enfoques tradicionales y al mismo tiempo preserva las capacidades fundamentales del modelo.

La semana pasada presentamos Amazon Nova Forge. Accesible en Amazon SageMaker AI, este nuevo servicio ofrece a los desarrolladores de IA la oportunidad de crear sus propios modelos de frontera utilizando Amazon Nova. Puede utilizar Nova Forge para iniciar el desarrollo del modelo desde los primeros puntos de control en las fases previas, intermedias y posteriores al entrenamiento, lo que significa que puede intervenir en la etapa óptima en lugar de esperar hasta que se complete el entrenamiento. Puede combinar sus datos patentados con datos seleccionados de Amazon Nova a lo largo de las fases de capacitación utilizando recetas demostradas en la infraestructura totalmente administrada de SageMaker AI. Este enfoque de combinación de datos reduce significativamente los olvidos catastróficos en comparación con el entrenamiento solo con datos sin procesar. Esto ayuda a preservar las habilidades fundamentales, incluida la inteligencia básica, las capacidades de seguimiento de instrucciones generales y los beneficios de seguridad, al mismo tiempo que incorpora su conocimiento especializado. Nova Forge es la forma más sencilla y rentable de crear su propio modelo de frontera.

El siguiente vídeo presenta Amazon Nova Forge.

Nova Forge está diseñado para organizaciones con acceso a datos propietarios o específicos de la industria que desean crear una IA que realmente comprenda su dominio, que incluye:

Fabricación y automatización: creación de modelos que comprendan procesos especializados y datos de equipos. Investigación y desarrollo: creación de modelos capacitados con datos de investigación patentados. Contenido y medios: desarrollo de modelos que comprendan la voz de la marca y los estándares de contenido. Industrias especializadas: modelos de capacitación sobre terminología, regulaciones y mejores prácticas específicas de la industria.

Empresas como Nomura Research Institute están utilizando Amazon Nova Forge para crear modelos de lenguajes grandes (LLM) específicos de la industria combinando datos seleccionados de Amazon Nova con sus conjuntos de datos patentados.

Takahiko Inaba, jefe de IA y director general de Nomura Research Institute, Ltd., dijo:

"Nova Forge nos permite crear LLM específicos de la industria como una alternativa convincente a los modelos abiertos. Al ejecutar SageMaker AI con infraestructura de capacitación administrada, podemos desarrollar de manera eficiente modelos especializados como nuestro LLM de servicios financieros japoneses combinando datos seleccionados de Amazon Nova con nuestros conjuntos de datos patentados".

Formación elástica para la gestión inteligente de recursos a escala

La demanda de aceleradores de IA fluctúa constantemente a medida que las cargas de trabajo de inferencia aumentan con los patrones de tráfico, los experimentos completados liberan recursos y los nuevos trabajos de capacitación cambian las prioridades. Las cargas de trabajo de capacitación tradicionales permanecen bloqueadas en su asignación informática inicial, incapaces de aprovechar la capacidad inactiva sin intervención manual, un proceso que consume horas de su tiempo de ingeniería cada semana.

El entrenamiento elástico en Amazon SageMaker HyperPod transforma esta dinámica. Los trabajos de capacitación ahora escalan automáticamente según la disponibilidad de recursos informáticos, expandiéndose para absorber aceleradores de IA inactivos y maximizar la utilización de la infraestructura. Cuando las cargas de trabajo de mayor prioridad, como la inferencia o la evaluación, necesitan recursos, la capacitación se reduce gradualmente para continuar con menos recursos en lugar de detenerse por completo.

La arquitectura técnica mantiene la calidad de la capacitación durante las transiciones de escalado al preservar el tamaño del lote global y la tasa de aprendizaje en diferentes configuraciones de datos paralelos. Esto admite propiedades de convergencia consistentes independientemente de la escala actual. El operador de capacitación de SageMaker HyperPod organiza decisiones de escalamiento a través de la integración con el plano de control de Kubernetes, monitoreando continuamente el estado del clúster a través de eventos del ciclo de vida del pod, cambios en la disponibilidad de los nodos y señales de prioridad del programador de recursos.

Comenzar es sencillo. Las nuevas recetas elásticas de SageMaker HyperPod para FM disponibles públicamente, incluidos Meta's Llama y GPT-OSS, no requieren cambios de código, solo actualizaciones de configuración YAML para especificar la política elástica.

Salesforce está utilizando la capacitación elástica para escalar automáticamente las cargas de trabajo y absorber las GPU inactivas a medida que estén disponibles, y explica que la capacitación elástica "permitirá que nuestras cargas de trabajo escale automáticamente para absorber las GPU inactivas a medida que estén disponibles y producir recursos sin problemas, todo sin interrumpir los ciclos de desarrollo. Lo más importante es que nos ahorrará horas dedicadas a reconfigurar trabajos manualmente para que coincidan con la computación disponible, tiempo que podemos reinvertir en innovación".

Minimizar el tiempo de inactividad de recuperación con entrenamiento sin puntos de control

Las fallas en la infraestructura han sido durante mucho tiempo el enemigo del progreso en la capacitación a gran escala. Las ejecuciones de entrenamiento que duran semanas pueden verse descarriladas por una falla de un solo nodo, lo que lo obliga a reiniciar desde su último punto de control y a perder horas o días de costoso tiempo de GPU. La recuperación tradicional basada en puntos de control implica etapas secuenciales: terminación y reinicio del trabajo, descubrimiento de procesos y configuración de la red, recuperación de puntos de control, reinicialización del contexto de GPU y reanudación del ciclo de entrenamiento. Cuando se producen fallas, todo el clúster debe esperar a que se completen todas las etapas antes de poder reanudar la capacitación.

La capacitación sin control en Amazon SageMaker HyperPod elimina este cuello de botella. El sistema mantiene la preservación continua del estado del modelo en clústeres distribuidos, intercambia automáticamente componentes defectuosos y recupera el entrenamiento mediante la transferencia entre pares de estados del modelo desde aceleradores de IA en buen estado. Cuando ocurren fallas en la infraestructura, la recuperación ocurre en segundos sin intervención manual. El siguiente vídeo presenta el entrenamiento sin puntos de control.

Esto se traduce en más del 95 % de un buen rendimiento de capacitación en tamaños de clúster con miles de aceleradores de IA, lo que significa que la infraestructura informática se utiliza activamente para trabajos de capacitación hasta el 95 % del tiempo. Ahora puede centrarse en la innovación en lugar de en la gestión de la infraestructura, acelerando el tiempo de comercialización en semanas.

Intercom ya está integrando capacitación sin puntos de control en sus canales para eliminar la recuperación manual de puntos de control, afirmando:

"En Intercom, entrenamos constantemente nuevos modelos para mejorar Fin, y estamos muy emocionados de integrar la capacitación sin puntos de control en nuestras tuberías. Esto eliminará por completo la necesidad de recuperación manual de puntos de control. Combinado con la capacitación elástica, nos permitirá ofrecer mejoras a Fin más rápido y con menores costos de infraestructura".

MLflow sin servidor: observabilidad para todos los desarrolladores de IA

Ya sea personalizando modelos o entrenando a escala, necesita capacidades para realizar un seguimiento de los experimentos, observar el comportamiento y evaluar el rendimiento. Sin embargo, la gestión de la infraestructura de MLflow tradicionalmente requiere que los administradores mantengan y escale continuamente los servidores de seguimiento, tome decisiones complejas de planificación de capacidad e implemente instancias separadas para el aislamiento de datos. Esta carga de infraestructura desvía recursos del desarrollo central de la IA.

Amazon SageMaker AI ahora ofrece una capacidad de MLflow sin servidor que elimina esta complejidad. Puede comenzar a rastrear, comparar y evaluar experimentos sin esperar a que se configure la infraestructura. MLflow se escala dinámicamente para ofrecer un rendimiento rápido para tareas de desarrollo de modelos exigentes e impredecibles y luego se reduce durante el tiempo de inactividad. La siguiente captura de pantalla muestra la aplicación MLFlow en la interfaz de usuario de SageMaker AI.

La capacidad funciona de forma nativa con la personalización del modelo sin servidor de IA de Amazon SageMaker para que pueda visualizar evaluaciones y trabajos de capacitación en progreso a través de una única interfaz. Las capacidades de seguimiento avanzadas ayudan a identificar rápidamente errores o comportamientos inesperados en flujos de trabajo agentes y aplicaciones de varios pasos. Los equipos pueden utilizar el Registro de avisos de MLflow para versionar, rastrear y reutilizar avisos en todas las organizaciones, manteniendo la coherencia y mejorando la colaboración.

La integración con SageMaker Model Registry proporciona una gobernanza perfecta del modelo, sincronizando automáticamente los modelos registrados en MLflow con el ciclo de vida de producción. Una vez que los modelos alcancen los objetivos de precisión y rendimiento deseados, puede implementarlos en los puntos finales de inferencia de IA de SageMaker con solo unos pocos clics.

Los administradores pueden ayudar a mejorar la productividad configurando el acceso entre cuentas utilizando AWS Resource Access Manager (AWS RAM) para simplificar la colaboración a través de los límites organizacionales. La capacidad de MLflow sin servidor se ofrece sin costo adicional y se actualiza automáticamente a la última versión de MLflow, brindándole acceso a las funciones más nuevas sin ventanas de mantenimiento ni esfuerzos de migración.

Wildlife Conservation Society está utilizando la nueva capacidad sin servidor para mejorar la productividad y acelerar el tiempo de obtención de conocimientos. Kim Fisher, ingeniero jefe de software de MERMAID, WCS, dijo:

"WCS está avanzando en la conservación global de los arrecifes de coral a través de MERMAID, una plataforma de código abierto que utiliza modelos de aprendizaje automático para analizar fotografías de arrecifes de coral de científicos de todo el mundo. Amazon SageMaker con MLflow ha mejorado nuestra productividad al eliminar la necesidad de configurar servidores de seguimiento de MLflow o administrar la capacidad a medida que cambian nuestras necesidades de infraestructura. Al permitir que nuestro equipo se centre completamente en la innovación de modelos, estamos acelerando nuestro tiempo de implementación para ofrecer información crítica impulsada por la nube a los científicos y administradores marinos".

Acelerar la innovación en IA en todos los niveles

Estos anuncios representan más que mejoras de funciones individuales: establecen un sistema integral para el desarrollo de modelos de IA que llega a los constructores en cualquier lugar de su viaje. Desde la personalización guiada por lenguaje natural hasta los flujos de trabajo autodirigidos, desde la gestión inteligente de recursos hasta la capacitación tolerante a fallas, desde el seguimiento de experimentos hasta la implementación de producción, Amazon SageMaker AI proporciona el conjunto de herramientas completo para transformar las ideas de IA en realidad de producción.

Empezando

La nueva personalización del modelo de IA de SageMaker y las capacidades de SageMaker HyperPod están disponibles hoy en las regiones de AWS de todo el mundo. Los clientes existentes de SageMaker AI pueden acceder a estas funciones a través de la consola de SageMaker AI, y los nuevos clientes pueden comenzar con la capa gratuita de AWS.

Para obtener más información sobre las capacidades más recientes de Amazon SageMaker AI, visite aws.amazon.com/sagemaker/ai.

Sobre los autores

Ankur Mehrotra se unió a Amazon en 2008 y actualmente es el director general de Amazon SageMaker AI. Antes de Amazon SageMaker AI, trabajó en la creación de sistemas publicitarios y tecnología de precios automatizados de Amazon.com.