Monitorear y solucionar problemas de puntos finales de inferencia de IA generativa que operan a escala es un desafío. Cuando la latencia P99 de su endpoint de modelo de lenguaje grande (LLM) aumenta, debe determinar en minutos si la causa principal es la presión de la memoria de la GPU, una caché KV saturada, un tráfico desequilibrado en las zonas de disponibilidad o una política de escalado automático que no se ha activado. El cambio de la capacitación al servicio está remodelando la forma en que los equipos implementan los LLM y otros modelos de IA generativa en producción. Los ingenieros de plataformas de aprendizaje automático (ML), los equipos de MLOps y los ingenieros de confiabilidad del sitio (SRE) deben mantener los puntos finales de inferencia en buen estado, con capacidad de respuesta y rentables, a menudo en docenas de modelos y cientos de instancias de GPU.
Amazon SageMaker AI proporciona alojamiento de inferencia en tiempo real totalmente administrado para modelos de aprendizaje automático. Implementa un modelo en un punto final de SageMaker respaldado por una o más instancias informáticas, y SageMaker maneja el aprovisionamiento y el escalado. SageMaker admite múltiples arquitecturas de puntos finales. Esta publicación se centra en las dos cargas de trabajo más relevantes para la IA generativa con observabilidad detallada:
Puntos finales de modelo único (SME): cada punto final aloja un modelo en instancias dedicadas. Las PYMES son fáciles de configurar y razonar, pero cada modelo requiere su propia flota de instancias de GPU. Puntos finales del componente de inferencia (IC): varios modelos comparten el mismo conjunto de instancias a través de componentes de inferencia. Cada componente de inferencia define un modelo, sus requisitos de recursos (CPU, GPU, memoria) y su política de escalado. Los puntos finales de IC son la arquitectura recomendada para cargas de trabajo de IA generativa de producción porque admiten alojamiento multimodelo en infraestructura de GPU compartida, escalado independiente por modelo y alta disponibilidad (HA) a través de la distribución de copias entre AZ.
Los puntos finales de SageMaker emiten métricas como recuentos de invocaciones, latencia del modelo y latencia general a Amazon CloudWatch. Estas métricas agregadas son útiles para comprender el estado general de los endpoints. Debido a que los equipos escalan a implementaciones multimodelo en flotas de GPU, necesitan señales más profundas. Amazon SageMaker AI ahora emite más de 100 métricas de inferencia detalladas. Estos cubren el estado de la GPU, la latencia a nivel de token, la presión de la caché KV, la distribución del tráfico entre las AZ, la ubicación de los componentes de inferencia y el diagnóstico de arranque en frío. Estas métricas fluyen a un panel de SageMaker Insights integrado en Amazon CloudWatch, una solución de observabilidad totalmente administrada que elimina la necesidad de paneles personalizados de Grafana y configuración de Prometheus. El panel de SageMaker Insights admite ambos tipos de puntos finales y muestra automáticamente paneles específicos de IC cuando se detectan componentes de inferencia.
Para obtener más detalles sobre la inferencia de SageMaker, consulte Implementar modelos para inferencia en tiempo real.
En esta publicación, aprenderá cómo:
Active métricas de observabilidad detalladas en puntos finales de inferencia de SageMaker nuevos y existentes. Navegue por el panel de SageMaker Insights para monitorear el estado de la flota en las vistas de Rendimiento, Capacidad y Confiabilidad. Conecte las métricas a su propia herramienta de observabilidad (Grafana, Datadog) a través del punto final compatible con PromQL.
Descripción general de la observabilidad de la inferencia de SageMaker
Los puntos finales de inferencia de SageMaker emiten métricas nativas de OpenTelemetry a CloudWatch. El panel de SageMaker Insights se encuentra en la consola de CloudWatch en Monitoreo de infraestructura → SageMaker Insights. Consulta estas métricas utilizando PromQL y genera visualizaciones a nivel de flota, punto final y componente de inferencia en tres pestañas: Rendimiento, Capacidad y Confiabilidad.
Rendimiento: estado de la flota, latencia del token, rendimiento, errores, presión del motor. Capacidad: utilización de GPU, CPU y memoria de la flota. Confiabilidad: distribución de zonas de disponibilidad, eventos de escalado, anatomía de arranque en frío y errores de capacidad insuficiente.
Servicios clave
Amazon SageMaker AI: inferencia administrada con puntos finales y componentes de inferencia. Amazon CloudWatch: soporte nativo para métricas de OpenTelemetry y consultas PromQL a través de SageMaker Insights.
Para obtener información general sobre la compatibilidad con OpenTelemetry y PromQL en CloudWatch, consulte Introducción a la compatibilidad con OpenTelemetry PromQL en Amazon CloudWatch.
Requisitos previos
Debes tener lo siguiente para seguir esta publicación.
Una cuenta de AWS con al menos un punto final de inferencia en tiempo real de SageMaker. Permisos de AWS Identity and Access Management (IAM): sagemaker:CreateEndpointConfig, sagemaker:UpdateEndpoint y cloudwatch:GetMetricData. Marco de contenedor vLLM o SGLang (requerido para métricas a nivel de token como TTFT e ITL).
Las instancias de GPU reciben métricas de utilización por acelerador además de las métricas de CPU y memoria disponibles en todos los tipos de instancias. Para obtener la guía de configuración completa, consulte Introducción a la observabilidad detallada.
Active métricas detalladas en sus endpoints
Nuevos puntos finales: Automático (activado de forma predeterminada)
Para cualquier configuración de punto final nueva que cree, las métricas detalladas están activadas de forma predeterminada. El parámetro EnableDetailedObservability en la configuración de su punto final tiene el valor predeterminado verdadero. No se requiere ningún código adicional.
El indicador EnableDetailedObservability en la configuración de su terminal tiene el valor predeterminado verdadero, por lo que no se necesita ninguna configuración adicional. También puede establecer explícitamente la frecuencia de publicación usando MetricsPublishFrequencyInSeconds en MetricsConfig. El valor predeterminado es 60 segundos. Para cargas de trabajo que necesitan monitoreo casi en tiempo real, puede configurarlo en menos de un minuto.
A los 2 minutos de que el punto final llegue a InService, las métricas del formato OpenTelemetry comienzan a fluir a CloudWatch.
Puntos finales existentes: suscripción
Los puntos finales existentes requieren una suscripción explícita. Cree una nueva configuración de punto final con el indicador MetricsConfig y luego actualice su punto final. Esto sigue el mismo patrón que cualquier cambio de configuración de endpoint.
La consola de SageMaker también proporciona un asistente guiado de tres pasos después de elegir Habilitar observabilidad detallada: conozca las métricas, active el enriquecimiento de OTel y seleccione qué puntos finales desea participar.
Habilite el enriquecimiento de OTel para métricas clásicas de CloudWatch
Las métricas nativas de OpenTelemetry fluyen automáticamente a CloudWatch después de la habilitación. Sin embargo, las métricas clásicas existentes (Invocaciones, ModelLatency, OverheadLatency) requieren que el enriquecimiento de OTel sea visible en el panel de SageMaker Insights y se pueda consultar con PromQL.
Navegue a la Consola de CloudWatch, luego a Configuración y active el enriquecimiento de métricas de OTel y las etiquetas de recursos para telemetría. Esta es una configuración única, a nivel de cuenta y a nivel de región de AWS.
Navegue al panel de SageMaker Insights desde la consola de SageMaker
Puede acceder al panel de SageMaker Insights a través de la consola de SageMaker o la consola de CloudWatch. Dentro de SageMaker, hay tres puntos de entrada, cada uno de ellos prefiltrado según su contexto:
# Filtro de punto de entrada aplicado Caso de uso 1 Página de lista de puntos finales → “Abrir SageMaker Insights” Nivel de flota (todos los puntos finales) “Dame una visión general” 2 Página de detalles del punto final → “Ver en SageMaker Insights” Filtrado a ese punto final “Profundizar en este punto final específico” 3 Ficha IC → enlace “Métricas” por IC Filtrado a punto final + IC “Depurar este componente de inferencia”
Cada ruta tiene enlaces profundos con filtros aplicados previamente, por lo que no terminará en un panel en blanco buscando sus recursos.
Pestaña Rendimiento: Supervisión del estado de la flota y latencia de depuración
La pestaña Rendimiento es donde la mayoría de los clientes pasan su tiempo. Responde preguntas como "¿Está todo funcionando bien?" y "Si no, ¿qué componente es el problema?" La pestaña Rendimiento incluye varios paneles de series temporales que funcionan en conjunto para identificar problemas de latencia.
Tabla de estado del rendimiento y rendimiento de la instancia
Los hexágonos codificados por colores visualizan todos los recursos de su flota. Alternar entre las vistas de instancias, copias IC y puntos finales. El color del hexágono indica el estado:
Verde para aceptar. Blanco para no detectar alarmas. Rojo para alarma.
Pase el cursor sobre cualquier hexágono para ver el tipo de instancia, TTFT, TPS de salida, solicitudes simultáneas, utilización de caché KV y estado de alarma de CloudWatch. Elija Filtrar por esta instancia para profundizar. Cada panel de la página se actualiza para mostrar solo los datos de esa instancia.
La tabla muestra cada instancia con métricas de rendimiento en paralelo. Utilice esta tabla para detectar valores atípicos en TTFT, TPS de salida y solicitudes simultáneas. Las columnas TTFT, TPS de salida, Solicitudes simultáneas y Caché KV muestran datos emitidos por los marcos vLLM y SGLang únicamente.
El panel de transmisión de tokens traza el tiempo hasta el primer token (TTFT) y la latencia entre tokens (ITL) a lo largo del tiempo con un interruptor P50/P99. TTFT mide cuánto tiempo esperan los usuarios antes de ver el primer carácter de respuesta. ITL mide el tiempo entre tokens consecutivos, lo que afecta directamente la fluidez de la transmisión. Puede filtrar por punto final, nombre del componente de inferencia o modelo para aislar qué componente contribuye a la latencia.
Cuando identifica un pico de TTFT, el panel de desglose de latencia le ayuda a atribuirlo. Este panel separa la latencia total en Latencia del modelo (tiempo que el modelo dedica al procesamiento) y Latencia general (tiempo que la plataforma dedica al enrutamiento y la programación). Una pestaña Invocar muestra la ruta completa de la solicitud y una pestaña Transmisión muestra específicamente el tiempo hasta el primer fragmento. Si tanto la latencia del modelo como la latencia general son normales pero el TTFT aún está elevado, es posible que el motor de inferencia del modelo esté reteniendo solicitudes en su cola interna, por ejemplo, esperando ranuras de caché KV. Verifique el motor y solicite el panel de presión para confirmar.
El panel de distribución de tráfico muestra el flujo de solicitudes por instancia o por componente de inferencia con filtrado de zona de disponibilidad. Cambie el menú desplegable AZ para aislar el tráfico por zona. Si una zona de disponibilidad muestra cero tráfico mientras que otras están cargadas, eso indica un problema de enrutamiento o ubicación. Puede utilizar la opción instancia/IC para alternar entre "¿Qué máquinas manejan el tráfico?" y "¿Qué modelos manejan el tráfico?" vistas.
Finalmente, el panel de rendimiento del token mide los tokens reales procesados por segundo, desglosados por entrada/salida, percentiles o por instancia. Esto mide directamente la eficiencia de la inferencia. Por ejemplo, si su ml.g6.4xlarge entrega 150 tokens por segundo cuando el modelo de referencia muestra 500, eso indica una restricción de recursos, un problema de configuración o presión de caché KV. La leyenda de múltiples marcos (SGLang, vLLM, DJL) permite que los puntos finales de múltiples modelos comparen el rendimiento entre motores de inferencia.
Presión del motor y demanda.
El panel de motor y presión de solicitud es su sistema de alerta temprana para evitar cortes.
La vista de serie temporal muestra el desglose por marco, con información sobre herramientas que muestra valores exactos en cualquier marca de tiempo. Si ve que la caché de KV aumenta repetidamente entre un 40 y un 50 por ciento durante el horario laboral, configure el escalado automático para que se active en un valor umbral antes de que los clientes sientan el impacto.
Pestaña Capacidad: planificación de implementaciones y gestión de recursos
La pestaña Capacidad responde a preguntas como "¿Tengo suficientes recursos?", "¿Dónde hay margen de maniobra?" y "¿Puedo adaptar otro modelo?"
Estado de la capacidad
Aquí reaparece la misma visualización en forma de panal de Rendimiento, con porcentajes de utilización de recursos en la tarjeta flotante: GPU, memoria de GPU, CPU, memoria de CPU y disco.
Antes de implementar un nuevo modelo o copias a escala, coloque el cursor sobre las instancias en su punto final de destino. Si la memoria de la GPU está al 89 por ciento, hay un margen de VRAM limitado para pesos de modelo adicionales.
Utilización de la flota a lo largo del tiempo
Este panel muestra las tendencias de consumo de recursos con opciones para instancias, copias de IC y agregación de puntos finales. Las señales clave incluyen las siguientes:
La tendencia ascendente de la memoria GPU a lo largo de los días indica que te estás acercando a los límites de capacidad. Agregue instancias antes de que la utilización alcance el límite. La caída repentina de la memoria de la GPU indica que un modelo falló o se descargó. Investigar. Los picos de disco que se repiten periódicamente se correlacionan con las descargas de modelos durante los arranques en frío.
Pestaña Confiabilidad: compatibilidad con la vista de alta disponibilidad y resiliencia
La pestaña Confiabilidad responde preguntas como "Si una AZ deja de funcionar, ¿sobrevivirá mi flota de inferencia?", "¿Funcionan los eventos de escalado?" y "¿Por qué los arranques en frío son lentos?"
Distribución de zonas de disponibilidad
Un gráfico de barras muestra el recuento de instancias y copias de IC por AZ. Esta vista muestra su postura de alta disponibilidad.
Acción de riesgo de distribución Incluso en más de 3 AZ Bajo Ninguna acción Concentrado en 1 o 2 AZ Medio Reequilibrio 0 instancias en cualquier AZ Alto Un fallo único de AZ lo desconecta
Alternar entre instancias y copias IC. Las instancias pueden estar equilibradas, pero las copias de circuitos integrados pueden concentrarse en unas pocas máquinas.
Anatomía del arranque en frío
Cada evento de aprovisionamiento de IC se muestra como una barra apilada horizontal con cuatro fases:
Fase Color Qué mide Optimización Descarga del modelo Azul Extraer pesos de modelo de Amazon Simple Storage Service (Amazon S3) Comprimir artefactos, usar almacenamiento en caché de Amazon Elastic File System (Amazon EFS) Carga de GPU Púrpura Cargar pesos en GPU Cuantización más pequeña, precalentamiento Inicio de contenedor Naranja Inicialización de contenedor Reducir dependencias
En la captura de pantalla, gma-ic-vllm tardó 237,6 segundos, dominando la descarga del modelo, mientras que gma-rblk-ic-tiny tardó solo 41,4 segundos porque es un modelo más pequeño. Esta vista le indica qué fase optimizar para lograr tiempos de respuesta de escalado más rápidos.
Diagnóstico de hielo
La vista de diagnóstico de ICE rastrea los errores de capacidad insuficiente (ICE), que ocurren cuando SageMaker no puede aprovisionar las instancias solicitadas. La tabla muestra:
Cuando ocurrió la falla. Qué punto final se vio afectado (enlaces profundos a la consola). Qué tipo de instancia no estaba disponible. Que AZ no tenía capacidad.
En la captura de pantalla anterior, los 12 eventos de ICE son para p5.48xlarge en las cuatro AZ, lo que indica un agotamiento regional completo para este tipo de instancia. Ahora sabe cómo cambiar a otros tipos de instancias como alternativa.
Para los equipos que ya cuentan con Grafana u otras herramientas compatibles con PromQL, pueden consultar las métricas de SageMaker Insights directamente desde su plataforma sin cambiar a la consola de CloudWatch. El siguiente tutorial demuestra la configuración con Grafana. Los mismos pasos se aplican a Grafana autohospedado u otras herramientas compatibles, con pequeñas diferencias de configuración.
Paso 1: Obtenga la URL del punto final de PromQL
Navegue hasta SageMaker Console y luego seleccione Puntos finales. Desde allí, seleccione su punto final y luego elija Conectarse a su herramienta de observabilidad. Copie la URL del punto final mostrada. Sigue el formato que se muestra en la consola de SageMaker.
Paso 2: configure su fuente de datos de Grafana
En Amazon Managed Grafana (Classic CloudWatch 2.4+) o Grafana autohospedado con el complemento Amazon Managed Service for Prometheus (v3.0.0+):
Navegue hasta Configuración, Fuentes de datos y luego Agregar fuente de datos. Seleccione Amazon Managed Service for Prometheus y establezca la URL en la URL del punto final PromQL del Paso 1. En Proveedor de servicios, ingrese monitoreo. Configure la autenticación SigV4 con una función de IAM que tenga los permisos cloudwatch:GetMetricData y cloudwatch:ListMetrics. Elija Guardar y probar. Deberías ver que la fuente de datos está funcionando.
Paso 3: importe la plantilla de panel prediseñadas
Descargue la plantilla JSON del panel desde la misma página Conéctese a su herramienta de observabilidad en la consola de SageMaker. Importe la plantilla JSON descargada a Grafana (Paneles → Importar), seleccione la fuente de datos de Prometheus que configuró en el Paso 2 y obtendrá paneles de rendimiento, capacidad y confiabilidad preconfigurados que coinciden con el diseño de SageMaker Insights.
Paso 4: Consultar métricas con PromQL
Con la fuente de datos conectada, puede escribir consultas PromQL personalizadas. Por ejemplo:
Caché KV vllm:kv_cache_usage_perc{"aws.sagemaker.endpoint.name"="ep-prsn-ic","aws.sagemaker.inference_component.name"="ic-qwen3-4b"} # Solicitudes activas vllm:num_requests_running{"aws.sagemaker.endpoint.name"="ep-prsn-ic","aws.sagemaker.inference_component.name"="ic-qwen3-4b"} # TTFT P99 histogram_quantile(0,99, tasa(vllm:time_to_first_token_segundos{"aws.sagemaker.endpoint.name"="ep-prsn-ic","aws.sagemaker.inference_component.name"="ic-qwen3-4b"}[5m]))
Precios
SageMaker no cobra por separado por emitir métricas de observabilidad detalladas. Las métricas se publican en Amazon CloudWatch en formato de datos OpenTelemetry y se aplican los precios de ingesta estándar de CloudWatch OpenTelemetry. Las métricas de OpenTelemetry ingeridas en CloudWatch se cobran a 0,50 USD por GB ingerido. Si activa el enriquecimiento de métricas vendidas de OTel (requerido para ver métricas clásicas de CloudWatch como Invocaciones y ModelLatency en el panel de Insights), las métricas enriquecidas también se cobran a $0,50 por GB. Para obtener ejemplos de precios detallados y una calculadora de costos, consulte la sección Métricas de OpenTelemetry en la página de precios de Amazon CloudWatch.
Limpiar
Para evitar cargos continuos, elimine los recursos de prueba en este orden:
Las instancias de GPU se facturan por segundo, mientras que los puntos finales están en servicio. Eliminar inmediatamente después de la prueba.
Conclusión
En esta publicación, habilitó métricas detalladas de SageMaker en puntos finales de inferencia y utilizó el panel integrado de SageMaker Insights para monitorear el estado de la flota, depurar la latencia usando métricas a nivel de token, validar la alta disponibilidad y planificar la capacidad para nuevas implementaciones.
Para comenzar, consulte los siguientes recursos:
Expresiones de gratitud
El panel de SageMaker Insights y las métricas de observabilidad detalladas son el resultado de una estrecha colaboración entre los equipos de Amazon SageMaker AI y Amazon CloudWatch. Agradecemos a los equipos de ingeniería, productos y arquitectura de soluciones cuyo trabajo hizo posible este lanzamiento.
También agradecemos a los siguientes colaboradores por su revisión y aportes en esta publicación de blog:
Felipe López – Arquitecto principal de GenAI/ML, AWS Sandeep Raveesh-Babu – Especialista mundial sénior SA, GenAI, AWS Johna Liu – Ingeniera de desarrollo de software sénior, Amazon SageMaker Raviprakash Darbha – Ingeniero de desarrollo de software sénior, Amazon SageMaker Prajwal Kammardi – Ingeniero de desarrollo de software, Amazon SageMaker Jiaxi Xu – Ingeniero de desarrollo de software, Amazon SageMaker Orcun Berkem – Ingeniero principal, observabilidad, Amazon CloudWatch Steve McCurry – Gerente principal de productos, Amazon CloudWatch