En 2025, Amazon SageMaker AI realizó varias mejoras diseñadas para ayudarlo a entrenar, ajustar y alojar cargas de trabajo de IA generativa. En la Parte 1 de esta serie, analizamos los planes de capacitación flexibles y las mejoras en el desempeño de los precios realizadas en los componentes de inferencia.
En esta publicación, analizamos las mejoras realizadas en la observabilidad, la personalización del modelo y el alojamiento de modelos. Estas mejoras facilitan que una clase completamente nueva de casos de uso de clientes se alojen en SageMaker AI.
Observabilidad
Las mejoras de observabilidad realizadas en SageMaker AI en 2025 ayudarán a brindar una visibilidad mejorada del rendimiento del modelo y el estado de la infraestructura. Las métricas mejoradas brindan seguimiento granular, a nivel de instancia y a nivel de contenedor, de la utilización de CPU, memoria, GPU y rendimiento de invocación con frecuencias de publicación configurables, para que los equipos puedan diagnosticar problemas de latencia e ineficiencias de recursos que antes estaban ocultas mediante la agregación a nivel de punto final. Las actualizaciones continuas para los componentes de inferencia ayudan a transformar la seguridad de la implementación al aliviar la necesidad de aprovisionamiento de infraestructura duplicado: las actualizaciones se implementan en lotes configurables con monitoreo de alarmas integrado de Amazon CloudWatch que activa reversiones automáticas si se detectan problemas, lo que facilita implementaciones sin tiempo de inactividad y minimiza el riesgo a través de una validación gradual.
Métricas mejoradas
SageMaker AI introdujo métricas mejoradas este año, lo que ayuda a brindar visibilidad granular del rendimiento de los endpoints y la utilización de recursos tanto a nivel de instancia como de contenedor. Esta capacidad aborda una brecha crítica en la observabilidad, facilitando a los clientes el diagnóstico de problemas de latencia, fallas de invocación e ineficiencias de recursos que anteriormente estaban ocultas por la agregación a nivel de punto final. Las métricas mejoradas brindan seguimiento a nivel de instancia de la utilización de CPU, memoria y GPU junto con métricas de rendimiento de invocación (latencia, errores, rendimiento) con dimensiones InstanceId para los puntos finales de SageMaker. Para los componentes de inferencia, las métricas a nivel de contenedor ofrecen visibilidad del consumo de recursos de réplicas de modelos individuales con dimensiones ContainerId e InstanceId.
Puede configurar la frecuencia de publicación de métricas, proporcionando monitoreo casi en tiempo real para aplicaciones críticas que requieren una respuesta rápida. La habilitación de autoservicio a través de un parámetro MetricsConfig simple en la API CreateEndpointConfig ayuda a reducir el tiempo de obtención de información y le ayuda a autodiagnosticar problemas de rendimiento. Las métricas mejoradas lo ayudan a identificar qué instancia o contenedor específico requiere atención, diagnosticar la distribución desigual del tráfico entre hosts, optimizar la asignación de recursos y correlacionar problemas de rendimiento con recursos de infraestructura específicos. La función funciona a la perfección con las alarmas de CloudWatch y las políticas de escalado automático, proporcionando monitoreo proactivo y respuestas automatizadas a anomalías de rendimiento.
Para habilitar métricas mejoradas, agregue el parámetro MetricsConfig al crear la configuración de su punto final:
Hay métricas mejoradas disponibles en todas las regiones de AWS tanto para puntos finales de modelo único como para componentes de inferencia, lo que proporciona una observabilidad integral para implementaciones de IA de producción a escala.
Implementación de Guardrail con actualizaciones continuas
SageMaker AI introdujo actualizaciones continuas para los componentes de inferencia, lo que ayuda a transformar la forma de implementar actualizaciones de modelos con mayor seguridad y eficiencia. Las implementaciones tradicionales azul/verde requieren el aprovisionamiento de infraestructura duplicada, lo que crea limitaciones de recursos, particularmente para cargas de trabajo con mucha GPU, como modelos de lenguaje grandes. Las actualizaciones continuas implementan nuevas versiones de modelos en lotes configurables mientras escalan dinámicamente la infraestructura, con alarmas integradas de CloudWatch que monitorean métricas para activar reversiones automáticas si se detectan problemas. Este enfoque ayuda a aliviar la necesidad de aprovisionar flotas duplicadas, reduce los gastos generales de implementación y permite actualizaciones sin tiempo de inactividad a través de una validación gradual que minimiza el riesgo y mantiene la disponibilidad. Para obtener más detalles, consulte Mejorar las barreras de seguridad de implementación con actualizaciones continuas de componentes de inferencia para la inferencia de IA de Amazon SageMaker.
Usabilidad
Las mejoras en la usabilidad de la IA de SageMaker se centran en eliminar la complejidad y acelerar el tiempo de obtención de valor para los equipos de IA. La personalización del modelo sin servidor reduce el tiempo de planificación de la infraestructura al aprovisionar automáticamente recursos informáticos según el modelo y el tamaño de los datos, admitiendo técnicas avanzadas como el aprendizaje reforzado a partir de recompensas verificables (RLVR) y el aprendizaje reforzado a partir de comentarios de IA (RLAIF) a través de flujos de trabajo basados en UI y en código con seguimiento de experimentos de MLflow integrado. La transmisión bidireccional permite aplicaciones multimodales en tiempo real al mantener conexiones persistentes donde los datos fluyen simultáneamente en ambas direcciones, lo que ayuda a transformar casos de uso como agentes de voz y transcripción en vivo de intercambios transaccionales en conversaciones continuas. La conectividad mejorada a través del soporte integral de AWS PrivateLink en todas las regiones y la compatibilidad con IPv6 ayuda a garantizar que las implementaciones empresariales puedan cumplir con estrictos requisitos de alineación de cumplimiento y, al mismo tiempo, preparar las arquitecturas de red para el futuro.
Personalización del modelo sin servidor
La nueva capacidad de personalización sin servidor de IA de SageMaker aborda un desafío crítico que enfrentan las organizaciones: el largo y complejo proceso de ajuste de los modelos de IA, que tradicionalmente lleva meses y requiere una importante experiencia en gestión de infraestructura. Muchos equipos tienen dificultades para seleccionar los recursos informáticos adecuados, gestionar la complejidad técnica de las técnicas avanzadas de ajuste, como el aprendizaje por refuerzo, y navegar por el flujo de trabajo de un extremo a otro, desde la selección del modelo hasta la evaluación y la implementación.
Esta solución sin servidor ayuda a eliminar estas barreras al aprovisionar automáticamente los recursos informáticos adecuados según el modelo y el tamaño de los datos, lo que permite a los equipos centrarse en el ajuste del modelo en lugar de la gestión de la infraestructura y ayuda a acelerar el proceso de personalización. La solución admite modelos populares, incluidos Amazon Nova, DeepSeek, GPT-OSS, Llama y Qwen, y proporciona flujos de trabajo de personalización basados en UI y en código que hacen que las técnicas avanzadas sean accesibles para equipos con distintos niveles de experiencia técnica.
La solución ofrece múltiples técnicas de personalización avanzadas, incluido el ajuste supervisado, la optimización de preferencias directas, RLVR y RLAIF. Cada técnica ayuda a optimizar los modelos de diferentes maneras, y la selección está influenciada por factores como el tamaño y la calidad del conjunto de datos, los recursos computacionales disponibles, los requisitos de las tareas, los niveles de precisión deseados y las limitaciones de implementación. La solución incluye seguimiento de experimentos integrado a través de MLflow sin servidor para el registro automático de métricas críticas sin modificaciones de código, lo que ayuda a los equipos a monitorear y comparar el rendimiento del modelo durante todo el proceso de personalización.
La flexibilidad de implementación es una característica clave, con opciones para implementar en Amazon Bedrock para inferencia sin servidor o en puntos finales de SageMaker AI para una gestión controlada de recursos. La solución incluye capacidades integradas de evaluación de modelos para comparar modelos personalizados con modelos base, un área de juegos interactiva para realizar pruebas con indicaciones o modo de chat y una integración perfecta con el entorno más amplio de Amazon SageMaker Studio. Este flujo de trabajo de un extremo a otro, desde la selección y personalización del modelo hasta la evaluación y la implementación, se maneja completamente dentro de una interfaz unificada.
Actualmente disponible en las regiones de EE. UU. Este (Norte de Virginia), EE. UU. Oeste (Oregón), Asia Pacífico (Tokio) y Europa (Irlanda), el servicio opera con un modelo de pago por token tanto para entrenamiento como para inferencia. Este enfoque de fijación de precios ayuda a que organizaciones de diferentes tamaños puedan personalizar los modelos de IA de manera rentable sin inversiones iniciales en infraestructura, y la arquitectura sin servidor ayuda a garantizar que los equipos puedan escalar sus esfuerzos de personalización de modelos en función del uso real en lugar de la capacidad aprovisionada. Para obtener más información sobre esta capacidad principal, consulte La nueva personalización sin servidor en Amazon SageMaker AI acelera el ajuste del modelo.
Transmisión bidireccional
SageMaker AI introdujo la capacidad de transmisión bidireccional en 2025, transformando la inferencia de los intercambios transaccionales en conversaciones continuas entre usuarios y modelos. Esta característica permite que los datos fluyan simultáneamente en ambas direcciones a través de una única conexión persistente, lo que admite casos de uso multimodal en tiempo real que van desde transcripción y traducción de audio hasta agentes de voz. A diferencia de los enfoques tradicionales en los que los clientes envían preguntas completas y esperan respuestas completas, la transmisión bidireccional permite que la voz y las respuestas fluyan simultáneamente: los usuarios pueden ver los resultados tan pronto como los modelos comienzan a generarlos, y los modelos pueden mantener el contexto a través de transmisiones continuas sin volver a enviar el historial de conversaciones. La implementación combina los protocolos HTTP/2 y WebSocket, con la infraestructura de SageMaker administrando conexiones multiplexadas eficientes desde los clientes a través de enrutadores para modelar contenedores.
La función admite implementaciones de tipo "traiga su propio contenedor" e integraciones de socios, y Deepgram actúa como socio de lanzamiento y ofrece su modelo de voz a texto Nova-3 a través de AWS Marketplace. Esta capacidad aborda los requisitos empresariales críticos para aplicaciones de IA de voz en tiempo real, particularmente para organizaciones con necesidades de cumplimiento estrictas que requieren que el procesamiento de audio permanezca dentro de su nube privada virtual (VPC) de Amazon, al tiempo que elimina la sobrecarga operativa tradicionalmente asociada con las soluciones de IA en tiempo real autohospedadas. El enfoque de conexión persistente reduce la sobrecarga de infraestructura derivada de los protocolos de enlace TLS y la administración de conexiones, reemplazando conexiones de corta duración con sesiones eficientes de larga duración.
Los desarrolladores pueden implementar la transmisión bidireccional a través de dos enfoques: crear contenedores personalizados que implementen el protocolo WebSocket en ws://localhost:8080/invocations-bidireccional-stream con la etiqueta Docker adecuada (com.amazonaws.sagemaker.capabilities.bidireccional-streaming=true) o implementar soluciones de socios prediseñadas como el modelo Nova-3 de Deepgram directamente desde AWS Marketplace. La función requiere que los contenedores manejen los marcos de datos entrantes de WebSocket y envíen marcos de respuesta a SageMaker, con implementaciones de muestra disponibles tanto en Python como en TypeScript. Para obtener más detalles, consulte Introducción de la transmisión bidireccional para inferencia en tiempo real en Amazon SageMaker AI.
IPv6 y enlace privado
Además, SageMaker AI amplió sus capacidades de conectividad en 2025 con soporte integral de PrivateLink en todas las regiones y compatibilidad con IPv6 para puntos finales públicos y privados. Estas mejoras ayudan significativamente a mejorar la accesibilidad y la seguridad del servicio para implementaciones empresariales. La integración de PrivateLink hace posible acceder a los puntos finales de IA de SageMaker de forma privada desde sus VPC sin atravesar la Internet pública, manteniendo el tráfico dentro de la infraestructura de red de AWS. Esto es particularmente valioso para organizaciones con estrictos requisitos de cumplimiento o políticas de residencia de datos que exigen conectividad privada para cargas de trabajo de aprendizaje automático.
La incorporación de compatibilidad con IPv6 para los puntos finales de IA de SageMaker aborda la creciente necesidad de direccionamiento IP moderno a medida que las organizaciones abandonan IPv4. Ahora puede acceder a los servicios de IA de SageMaker utilizando direcciones IPv6 tanto para puntos finales públicos como para puntos finales privados de VPC, lo que brinda flexibilidad en el diseño de la arquitectura de red e inversiones en infraestructura preparadas para el futuro. La capacidad de doble pila (que admite IPv4 e IPv6) facilita la compatibilidad con versiones anteriores y ayuda a las organizaciones a adoptar IPv6 a su propio ritmo. Combinadas con PrivateLink, estas mejoras de conectividad ayudan a que SageMaker AI sea más accesible y seguro para diversos entornos de redes empresariales, desde centros de datos locales tradicionales que se conectan mediante AWS Direct Connect hasta arquitecturas modernas basadas en la nube construidas completamente en IPv6.
Conclusión
Las mejoras de 2025 en SageMaker AI representan un importante avance para hacer que las cargas de trabajo de IA generativa sean más observables, confiables y accesibles para los clientes empresariales. Desde métricas de rendimiento granulares que identifican los cuellos de botella de la infraestructura hasta la personalización sin servidor, estas mejoras abordan los desafíos del mundo real que enfrentan los equipos al implementar IA a escala. La combinación de observabilidad mejorada, mecanismos de implementación más seguros y flujos de trabajo optimizados ayuda a las organizaciones a avanzar más rápido mientras mantienen los estándares de confiabilidad y seguridad necesarios para los sistemas de producción.
Estas capacidades están disponibles ahora en todas las regiones, con características como métricas mejoradas, actualizaciones continuas y personalización sin servidor listas para ayudar a transformar la forma en que puede crear e implementar aplicaciones de IA. Ya sea que esté ajustando modelos para tareas específicas de un dominio, creando agentes de voz en tiempo real con transmisión bidireccional o facilitando la seguridad de la implementación con actualizaciones continuas y monitoreo integrado, SageMaker AI le ayuda a proporcionar las herramientas para acelerar su viaje hacia la IA y al mismo tiempo reducir la complejidad operativa.
Comience hoy explorando la documentación de métricas mejoradas, probando la personalización del modelo sin servidor o implementando transmisión bidireccional para sus cargas de trabajo de inferencia en tiempo real. Para obtener orientación completa sobre la implementación de estas características, consulte la documentación de IA de Amazon SageMaker o comuníquese con el equipo de su cuenta de AWS para analizar cómo estas capacidades pueden respaldar sus casos de uso específicos.
Sobre los autores
Dan Ferguson es arquitecto sénior de soluciones en AWS, con sede en Nueva York, EE. UU. Como experto en servicios de aprendizaje automático, Dan trabaja para ayudar a los clientes en su camino hacia la integración de flujos de trabajo de aprendizaje automático de manera eficiente, efectiva y sostenible.
Dmitry Soldatkin es arquitecto senior de soluciones de aprendizaje automático en AWS y ayuda a los clientes a diseñar y crear soluciones de IA/ML. El trabajo de Dmitry cubre una amplia gama de casos de uso de ML, con un interés principal en la IA generativa, el aprendizaje profundo y la ampliación del ML en toda la empresa. Ha ayudado a empresas de muchos sectores, incluidos seguros, servicios financieros, servicios públicos y telecomunicaciones. Le apasiona la innovación continua y el uso de datos para impulsar los resultados comerciales. Antes de unirse a AWS, Dmitry fue arquitecto, desarrollador y líder tecnológico en los campos de análisis de datos y aprendizaje automático en la industria de servicios financieros.
Lokeshwaran Ravi es ingeniero senior de compiladores de aprendizaje profundo en AWS y se especializa en optimización de aprendizaje automático, aceleración de modelos y seguridad de inteligencia artificial. Se centra en mejorar la eficiencia, reducir costos y crear ecosistemas seguros para democratizar las tecnologías de IA, haciendo que el aprendizaje automático de vanguardia sea accesible y tenga impacto en todas las industrias.
Sadaf Fardeen lidera la carta de optimización de inferencias para SageMaker. Es propietaria de la optimización y el desarrollo de contenedores de inferencia LLM en SageMaker.
Suma Kasa es arquitecto de aprendizaje automático en el equipo de servicios de SageMaker y se centra en la optimización y el desarrollo de contenedores de inferencia LLM en SageMaker.
Ram Vegiraju es arquitecto de aprendizaje automático en el equipo de servicio de SageMaker. Se centra en ayudar a los clientes a crear y optimizar sus soluciones de IA/ML en Amazon SageMaker. En su tiempo libre le encanta viajar y escribir.
Deepti Ragha es ingeniera sénior de desarrollo de software en el equipo de inteligencia artificial de Amazon SageMaker y se especializa en infraestructura de inferencia de aprendizaje automático y optimización de alojamiento de modelos. Ella crea funciones que mejoran el rendimiento de la implementación, reducen los costos de inferencia y hacen que el aprendizaje automático sea accesible para organizaciones de todos los tamaños. Fuera del trabajo, le gusta viajar, hacer senderismo y hacer jardinería.