Cree análisis de autoservicio de AWS Health para encontrar información de salud procesable con agentes de IA con tecnología de Amazon Bedrock

En un típico lunes por la mañana, un equipo de operaciones empresariales recibe múltiples notificaciones de AWS Health sobre el fin de vida útil de Amazon Linux 2, la desactivación de la versión de RDS y el retiro de instancias EC2 en más de 50 cuentas. Sin análisis de autoservicio, el equipo no tiene forma de identificar rápidamente los eventos que afectan los sistemas de producción, los eventos que requieren acción inmediata versus planificación a largo plazo y el impacto comercial de cada categoría de evento.

Los equipos de operaciones también pasan tiempo esperando a que los administradores técnicos de cuentas (TAM) interpreten los eventos de salud, lo que añade retrasos a las decisiones operativas críticas. El resultado es que se dedica más tiempo a combatir incendios de forma reactiva que a innovar.

En esta publicación, le mostramos cómo crear Chaplin (Nexo de inteligencia de ciclo de vida planificado y salud del cliente), una solución de código abierto que utiliza agentes de IA expuestos a través del Protocolo de contexto modelo (MCP) para proporcionar análisis de eventos de salud de autoservicio. Con Chaplin, los equipos pueden hacer preguntas en lenguaje natural directamente desde asistentes de IA compatibles con MCP y recibir respuestas precisas y contextualizadas sin depender de AWS Support para análisis de rutina. Las instrucciones de implementación detalladas están disponibles en el repositorio de GitHub de Chaplin AWS Health Agentic Assistant.

El desafío: gestión reactiva de eventos de salud

Las empresas que ejecutan cargas de trabajo de producción en AWS administran un flujo constante de eventos de estado (cambios de servicio, ventanas de mantenimiento, parches de seguridad y notificaciones operativas) en docenas o cientos de cuentas. AWS Health proporciona datos completos de eventos a través de la API de AWS Health y Amazon EventBridge, pero los enfoques de gestión reactiva dejan lagunas.

Los equipos dependen de los TAM para la interpretación de eventos de salud y el análisis de impacto, lo que crea obstáculos en la toma de decisiones. Los paneles de inteligencia empresarial con esquemas predefinidos no pueden adaptarse a preguntas dinámicas ni proporcionar la información contextual que los equipos de operaciones necesitan en este momento. Los equipos de DevOps y operaciones en la nube dedican mucho tiempo a categorizar y priorizar manualmente miles de eventos de salud repartidos en múltiples cuentas y regiones. Sin una ubicación central para el análisis, es difícil evaluar el impacto general, coordinar respuestas entre equipos o identificar oportunidades proactivas, como planificar migraciones o programar el mantenimiento antes de que los problemas se vuelvan críticos.

Los eventos de salud elegibles pronto se vincularán directamente a las plantillas de AWS Transform, lo que permitirá a los clientes actuar directamente en los eventos. Chaplin puede sacar a la luz y priorizar estos eventos procesables para su entorno.

Descripción general de la solución: análisis de autoservicio con Chaplin

Chaplin implementa análisis de eventos de salud de autoservicio utilizando IA agente impulsada por Amazon Bedrock, entregada a través del Protocolo de contexto modelo (MCP). En lugar de esquemas de paneles predefinidos, Chaplin expone herramientas impulsadas por IA que los clientes compatibles con MCP pueden consumir. Los equipos interactúan con Chaplin directamente desde su asistente de IA (como Claude Code o Kiro CLI) y hacen preguntas en lenguaje natural. Por ejemplo, un miembro del equipo podría solicitar los próximos eventos del ciclo de vida de RDS en los próximos 60 días, solicitar un resumen de los eventos EC2 abiertos priorizados por urgencia, consultar parches de seguridad que afectan los entornos de producción o verificar qué ventanas de mantenimiento podrían afectar las aplicaciones de alta prioridad.

Sus equipos pueden continuar realizando consultas hasta que tenga toda la información necesaria para tomar una decisión informada y elaborar un plan de remediación. Este enfoque permite a los equipos de DevOps, seguridad y operaciones analizar de forma independiente eventos de salud, planificar migraciones y evaluar los impactos operativos sin crear cuellos de botella. Debido a que Chaplin usa MCP, los equipos también pueden combinarlo con otras herramientas habilitadas para MCP (como JIRA, GitHub o ServiceNow) en su flujo de trabajo para realizar acciones con experiencia de agente.

Además, MCP permite la asociación directa de datos y metadatos de AWS con el contexto a nivel empresarial o de aplicación, como etiquetas de recursos, clasificaciones de entorno e información de propiedad, lo que enriquece el análisis de eventos de salud con relevancia organizacional.

Cómo la IA agente unifica datos estructurados y no estructurados

Chaplin utiliza una arquitectura de múltiples agentes que aborda un desafío fundamental en el análisis de datos empresariales: combinar eficazmente el procesamiento de datos estructurados y no estructurados. Los sistemas tradicionales de recuperación-generación aumentada (RAG) y los enfoques de IA generativa enfrentan una limitación crítica: son inherentemente no deterministas cuando manejan operaciones numéricas y agregaciones. La búsqueda de similitud de vectores, la base de RAG, recupera contenido semánticamente similar pero no puede garantizar la precisión matemática. Cuando se les pide que cuenten, sumen o agreguen datos, los sistemas basados ​​en RAG pueden alucinar resultados (por ejemplo, informar 190 eventos de salud relacionados con el final de la vida cuando el recuento real es 958). Este no determinismo surge de la naturaleza probabilística tanto del mecanismo de recuperación (que clasifica los documentos por similitud semántica en lugar de coincidencias exactas) como del proceso de generación del modelo de lenguaje (que predice tokens probables en lugar de calcular valores precisos).

Los eventos de AWS Health presentan exactamente este desafío. Cada evento contiene metadatos estructurados (tipo de evento, nombre de servicio, recursos afectados, marcas de tiempo, niveles de gravedad e ID de cuenta) que requieren filtrado y agregación precisos. Cada evento también contiene descripciones no estructuradas con explicaciones del problema en lenguaje natural, evaluaciones de impacto y acciones recomendadas que requieren comprensión semántica y análisis contextual.

Procesamiento inteligente de consultas

Cuando le haces una pregunta a Chaplin, tres componentes especializados trabajan juntos. El agente de lenguaje natural a consulta estructurada convierte preguntas en inglés simple en consultas precisas de datos estructurados contra metadatos de eventos de salud. Entiende el esquema de sus eventos de salud (qué campos existen, como tipo_de_evento, cuentas_afectadas y hora_de_inicio) y construye filtros que coinciden con su intención. Una pregunta como "Muéstrame las jubilaciones de EC2 en cuentas de producción" se convierte en una consulta estructurada con filtros de campo exactos en lugar de concordancia de palabras clave.

El Agente de análisis de impacto contextual maneja descripciones de eventos de salud no estructurados combinándolas con los metadatos de sus clientes: entornos de producción versus no producción, unidades de negocios, niveles de aplicaciones e información de propiedad. Este agente realiza un razonamiento a nivel de sistema, interpretando no solo lo que dice el evento sino también lo que significa para su infraestructura específica y contexto organizacional. El motor de clasificación basado en patrones clasifica los eventos de salud mediante la coincidencia de patrones basada en reglas, lo que elimina los costos de procesamiento de IA para la categorización de rutina y al mismo tiempo mantiene una alta precisión. Esta capa de optimización de costos hace que la solución sea práctica a escala.

Arquitectura de IA con costes optimizados

Chaplin implementa una optimización inteligente de costos mediante la mejora selectiva de la IA. El sistema utiliza un enfoque de procesamiento de patrones en el que la clasificación basada en reglas maneja la mayoría de los eventos sin incurrir en costos de IA. Las vistas resumidas prediseñadas para períodos de 30, 60 y 120 días con filtros ayudan a los equipos a identificar rápidamente alertas críticas. En la implementación actual, Amazon Bedrock with Claude procesa solo datos no estructurados que requieren análisis contextual. Pero la solución también es independiente del LLM y admite múltiples proveedores de modelos como Amazon Bedrock, OpenAI, Anthropic o modelos locales como Ollama, lo que brinda flexibilidad según sus requisitos y limitaciones de costos. El almacenamiento en caché inteligente reduce el procesamiento redundante de IA y la precisión de las consultas estructuradas utiliza el esquema de la API de AWS Health para un análisis numérico exacto sin costos de inferencia de IA.

Descripción general de la arquitectura

El siguiente diagrama ilustra la arquitectura Chaplin completa. Muestra cómo los eventos de salud fluyen desde múltiples cuentas de AWS a través de un canal de datos centralizado, hacia un servidor MCP impulsado por agentes de IA creados en Amazon Bedrock y, finalmente, hacia asistentes de IA compatibles con MCP donde los equipos interactúan con los datos a través del lenguaje natural. Cada capa se describe en detalle después del diagrama.

Figura 1: Arquitectura Chaplin que muestra un sistema de tres capas con recopilación de datos de múltiples cuentas, servidor MCP impulsado por IA con agentes de Amazon Bedrock e integración de cliente MCP”.

La arquitectura consta de tres capas principales que trabajan juntas para ofrecer análisis inteligentes de eventos de salud.

1. Capa de datos: capa de recopilación (varias cuentas)

El nivel de datos recopila eventos de salud de toda su organización de AWS y los centraliza para su análisis. En cada cuenta de miembro, la API de AWS Health actúa como fuente de eventos de salud. Amazon EventBridge proporciona activadores controlados por eventos para captura en tiempo real, y las funciones del recopilador de AWS Lambda recuperan eventos mediante roles de IAM entre cuentas configurados con acceso con privilegios mínimos.

Estos eventos fluyen a una cuenta de administración centralizada donde un lago de datos de Amazon Simple Storage Service (Amazon S3) almacena los eventos de salud recopilados con partición inteligente por cuenta, fecha y tipo de evento. Cuando llegan nuevos eventos, las notificaciones de eventos de S3 activan una función de AWS Lambda que procesa los eventos de estado JSON y los carga en Amazon DynamoDB para realizar consultas rápidas.

Esta arquitectura de cuentas múltiples admite dos modelos de implementación:

Opción 1: API de AWS Organizations para una implementación centralizada y automatizada en sus cuentas. Opción 2: Implementaciones de cuentas individuales para organizaciones con restricciones de seguridad.

2. Nivel medio: servidor MCP y capa de inteligencia

El nivel medio es donde los datos de eventos de salud sin procesar se transforman en inteligencia procesable y se exponen a través de un servidor MCP. Amazon DynamoDB sirve como almacén de datos principal para metadatos de eventos de salud estructurados, optimizado para consultas rápidas con índices sobre tipo de evento, gravedad, fecha y cuenta. Esto permite el acceso en tiempo real tanto para la clasificación basada en patrones como para el análisis de IA.

Un clasificador de eventos basado en patrones proporciona la primera capa de inteligencia. Este motor de categorización basado en reglas utiliza patrones de expresiones regulares en tipos de eventos para asignar eventos a cinco categorías comerciales: requisitos de migración, seguridad y cumplimiento, mantenimiento y actualizaciones, eventos de impacto en los costos y notificaciones operativas. Debido a que la mayoría de los eventos siguen patrones predecibles, este enfoque procesa la mayoría de los eventos mediante una coincidencia de patrones eficiente sin incurrir en costos de IA.

Para eventos que requieren un análisis más profundo, el motor de análisis impulsado por IA creado en Amazon Bedrock se hace cargo. Este motor utiliza el marco Strands Agents, un marco agente de código abierto desarrollado por AWS, con Claude 4.5 Sonnet como modelo de lenguaje grande. Puede cambiar esto a un LLM preferido de su elección. Tres agentes especializados manejan diferentes aspectos del análisis: un Agente de consultas SQL convierte consultas de lenguaje natural en consultas estructuradas de DynamoDB para un análisis numérico preciso, un Agente de análisis de impacto evalúa descripciones de eventos no estructurados con respecto a los metadatos del cliente, como el entorno, la unidad de negocios y la propiedad, y un Agente DBQueryBuilder genera consultas de bases de datos optimizadas para agregaciones multidimensionales. Todas estas capacidades están expuestas como herramientas MCP que los clientes compatibles pueden invocar.

3. Nivel de presentación – Cliente MCP – Integración del asistente de IA

El nivel de presentación consta de un asistente de IA compatible con MCP, como Claude Code o Kiro CLI. En lugar de una interfaz personalizada, Chaplin expone sus capacidades como herramientas MCP que estos clientes consumen de forma nativa. Los usuarios interactúan a través del lenguaje natural en su entorno de desarrollo existente, y el asistente de IA organiza llamadas al servidor MCP de Chaplin para recuperar datos de eventos de salud, ejecutar análisis impulsados ​​por IA y presentar resultados contextualizados, todo dentro de la misma interfaz conversacional que ya utilizan para las tareas de desarrollo.

La seguridad depende de AWS Identity and Access Management (AWS IAM) para la autenticación y autorización. El cliente MCP monta las credenciales de AWS como de solo lectura y el acceso se controla mediante roles de IAM con principios de privilegios mínimos. Los datos se cifran con TLS 1.2+ en tránsito y AES-256 en reposo, y AWS CloudTrail proporciona registros de auditoría para llamadas API.

Capacidades clave

Chaplin proporciona tres capacidades principales que abordan las brechas en la forma en que las organizaciones administran los eventos de AWS Health en la actualidad.

Chaplin ofrece análisis conversacional dinámico. Genera información procesable a pedido basada en sus preguntas específicas, proporcionando desgloses precisos con recuentos exactos, cuentas afectadas y análisis contextual, generados dinámicamente dentro de su asistente de IA sin informes ni paneles prediseñados. Chaplin ofrece esto a través de tres capacidades integradas:

Herramientas de inteligencia sanitaria impulsadas por MCP

Chaplin expone un conjunto completo de herramientas MCP organizadas en tres categorías. Las herramientas de resumen consultan DynamoDB directamente y regresan instantáneamente, proporcionando recuentos de alto nivel por servicio, estado, categoría y región. Las herramientas de detalles le permiten profundizar en categorías de eventos específicos, tipos de eventos o listas de eventos filtrados. Las herramientas de análisis de IA utilizan Strands Agents con Amazon Bedrock para interpretar sus consultas en lenguaje natural, obtener datos relevantes y generar información contextual.

Canalización de datos de múltiples cuentas

Chaplin recopila eventos de salud de sus cuentas de AWS y centraliza los datos en Amazon S3, lo que admite modelos de implementación flexibles basados ​​en su postura de seguridad. La canalización de datos consta de funciones de AWS Lambda para la ingesta automatizada de eventos de salud, programadores de Amazon EventBridge con frecuencia de recopilación configurable (diaria o por hora), roles de IAM entre cuentas para la recopilación segura de datos de múltiples cuentas con principios de privilegios mínimos, un lago de datos de Amazon S3 con partición para consultas eficientes y administración automatizada del ciclo de vida con políticas de retención configurables.

Procesamiento analítico preciso

Chaplin combina el procesamiento de datos estructurados y no estructurados para un análisis integral. Para datos estructurados, ofrece resultados numéricos exactos que incluyen recuentos y distribuciones de eventos, análisis de línea de tiempo con detección de tendencias, agregaciones multidimensionales en dimensiones de cuentas, servicios y gravedad, y desgloses categóricos con porcentajes precisos. Para datos no estructurados, proporciona información contextual, como evaluación de impacto basada en descripciones de eventos, identificación de deficiencias arquitectónicas, correlación de riesgos entre eventos relacionados y acciones recomendadas según el contexto del evento.

Tutorial de implementación: gestión del ciclo de vida de instancias EC2

Para ilustrar la amplitud de lo que Chaplin puede hacer, el siguiente tutorial muestra una serie de consultas en lenguaje natural realizadas a través de Kiro CLI. Estos ejemplos están organizados por caso de uso, desde obtener una descripción general operativa rápida hasta profundizar en servicios específicos y planificar la remediación.

Nota: Los siguientes ejemplos utilizan datos de muestra para ilustrar las capacidades de Chaplin. Sus respuestas reales variarán según los eventos de salud en su entorno de AWS.

Obtener una imagen operativa

Un equipo que comienza su día puede evaluar rápidamente el estado actual de los eventos de salud en sus cuentas e identificar qué necesita atención inmediata:

¿Cuál es el impacto estimado de la obsolescencia de RDS PostgreSQL para nuestras cuentas de producción de nivel 1, clasificadas por gasto mensual en riesgo?

Todos los eventos son del tipo AWS_RDS_PLANNED_LIFECYCLE_EVENT. 6 de 10 cuentas tienen fechas límite que ya están vencidas, siendo la más antigua CustomerSupport-production-5365 (octubre de 2024). La fecha límite de la cuenta de Órdenes del 15 de mayo de 2026 es el próximo evento más urgente.

Cuentas de nivel 1 6 cuentas | 14 eventos | $304,400/mes en riesgo

Cuenta BU División Gasto/mes Eventos Fecha límite Analytics-production-8137 Analytics Retail $76 700 2 2025-03-31 DataScience-production-9480 DataScience Retail $70 900 1 2026-07-14 Payments-production-2382 Payments Engineering $50 000 3 2025-03-31 Security-production-2466 Ingeniería de seguridad $40,900 3 2025-09-30 Logística-producción-5002 Logística FinTech $33,900 2 2025-03-31 Casos de soporte – Cuenta de prueba Q 3 Pedidos al por menor $32,000 3 2026-05-15

Cuentas de nivel 2 4 cuentas | 7 eventos | $73,700/mes en riesgo

Cuenta División BU Gasto/mes Eventos Fecha límite Payments-production-8452 Pagos Retail $24 700 1 2026-07-31 CustomerSupport-prod-5365 CustSupport Engineering $21 000 2 2024-10-31 Central de recolección de casos Infraestructura de operaciones $15 000 2 2025-11-01 Analytics-production-2965 Análisis FinTech $13,000 2 2025-09-30

Pruebe estas consultas de seguimiento

"¿Cuáles son las estadísticas del tipo de evento?"

"Muéstrame los próximos eventos críticos en los próximos 30 días"

“¿Cuáles son los próximos eventos críticos en los próximos 30 a 60 días?”

“Muéstrame los eventos vencidos de los últimos 120 días”

Profundizando en servicios y eventos específicos

Una vez que el equipo identifica áreas de preocupación, pueden profundizar en servicios específicos, categorías de eventos o vistas filtradas.

Por ejemplo, al preguntar sobre los cambios programados se obtiene un desglose detallado por servicio, estado y cronograma:

¿Cuáles son los eventos de cambio programado: mantenimiento planificado y cambios?

Aquí está el desglose de los eventos de cambios programados: 728 eventos en total en 8 servicios.

Resumen por estado

Estado Conteo Cerrado 596 Abierto 107 Próximos 25

Por servicio

Eventos de servicio EC2 493 OpenSearch (ES) 92 SageMaker 84 Direct Connect 39 Kinesis Analytics 8 DocumentDB 6 Q Business 3 RDS 3

Eventos activos (abiertos + próximos): aspectos destacados clave

25 próximos eventos (todos EC2 y Direct Connect, del 14 al 31 de agosto):

Reinicio de instancia EC2 (mantenimiento flexible): 11 eventos en varias cuentas, períodos del 16 al 31 de agosto Retiro de instancia persistente EC2: 6 eventos, 23 al 24 de agosto Parada de instancia EC2: 4 eventos, 15 al 23 de agosto Retiro de host dedicado EC2: 1 evento, 27 de agosto Mantenimiento de conexión directa: 2 eventos, 14 y 25 de agosto

107 eventos abiertos (los notables):

EC2 ODCR (Reservas de capacidad bajo demanda): múltiples eventos en la cuenta 230463653608 (sin fecha de finalización) Mantenimiento de Kinesis Analytics (Apache Flink): 2 cuentas, ventana del 6 al 15 de agosto Mantenimiento de SageMaker Notebooks: 1 evento en la cuenta 783088110329

Cuentas con mayor actividad

638942336102: actividad intensa de reinicio/retiro de EC2 230463653608: múltiples eventos abiertos programados de ODCR 238917806813: varios reinicios próximos de EC2

Estas son las cuentas principales con número de problemas repetidos y notificaciones de cuenta. Todo esto surge de estos problemas en su arquitectura. ¿Quieres información sobre cómo solucionar este problema para reducir estas notificaciones?

Pruebe estas consultas de seguimiento

"Muéstrame eventos de cambio programados de LAMBDA abiertos"

"Profundizar en los eventos S3 en us-east-1"

"Muéstrame Eventos de problemas: problemas e interrupciones del servicio"

"¿Cuáles son los eventos de cambio programado: mantenimiento planificado y cambios?"

"Muéstrame alertas de configuración: problemas de configuración, recursos vencidos"

“¿Qué requisitos de migración existen: migraciones de plataforma, actualizaciones de versión, retiros de instancias?”

Análisis y planificación de remediación impulsados ​​por IA

¿Qué cuentas tienen la mayor cantidad de eventos de salud abiertos para EC2?

Aquí están las cuentas clasificadas por eventos de salud EC2 abiertos:

Cuentas principales por eventos EC2 abiertos

Clasificación Eventos de apertura de cuenta Tipos de eventos clave 1 230463653608 22 ODCR programado (9), ODCR pendiente (8), ODCR cancelado (6), depósito de ODCR (3) 2 238917806813 19 Recuperación automática exitosa (17), evento de ciclo de vida planificado (1) ⚠ 3 513658358123 11 Recuperación automática exitosa (10), Fallo de recuperación automática (1) ⚠ 4 518792048957 5 Recuperación automática exitosa (4), Recuperación automática exitosa de instancia (1) 5 456303994757 3 Recuperación automática exitosa 6 175059432382 3 Recuperación automática exitosa 7 559084127189 3 Recuperación automática exitosa 8 316575346316 2 Recuperación automática exitosa

Para un análisis más profundo, el agente de IA interpreta la pregunta, obtiene datos relevantes y genera información contextual con acciones recomendadas.

Pruebe estas consultas de seguimiento

"Dame un plan para remediar el evento crítico Lambda"

"¿Puedes consultar los próximos eventos de RDS?"

"Dame eventos Lambda abiertos y resalta los críticos"

“¿Qué modelos Bedrock van a llegar al final de su vida útil?”

"¿Qué cuentas tienen las notificaciones de salud más repetidas y qué problemas arquitectónicos las causan?"

Cada una de estas consultas demuestra una faceta diferente de las capacidades de Chaplin: búsquedas estructuradas instantáneas desde DynamoDB para obtener resúmenes operativos, desgloses filtrados por servicio, región o tipo de evento, y análisis contextual impulsado por IA que genera información y recomienda pasos de remediación específicos. Debido a que esto se ejecuta en un asistente de IA compatible con MCP, la conversación es fluida: cada respuesta conduce naturalmente a la siguiente pregunta y los equipos pueden combinar Chaplin con otras herramientas de MCP en la misma sesión.

El siguiente ejemplo demuestra cómo Chaplin combina múltiples herramientas MCP para responder una pregunta analítica compleja. Cuando se le pregunta sobre eventos de salud recurrentes y remediación arquitectónica, el agente de IA organiza llamadas a get_health_summary, get_event_categories, get_estimated_blast_radius y get_event_type_stats para producir una respuesta integral:

¿Qué cuentas tienen las notificaciones de salud más repetidas y qué problemas arquitectónicos las causan?

get_health_summary

get_event_categories

get_estimated_blast_radius (servicio=ELASTICACHE, sort_by_tag=Nivel)

get_estimated_blast_radius (servicio=VPN, sort_by_tag=Nivel)

get_estimated_blast_radius (servicio=EC2, sort_by_tag=Nivel)

get_event_type_stats

Cuentas con los eventos de salud más recurrentes

Eventos de servicio Cuentas afectadas Gasto en riesgo ElastiCache 2145 (45 %) 140 $717 000/mes VPN 647 (14 %) 14 $33,5 000/mes EC2 351 (7 %) 62 $544 000/mes ECS 297 — — CloudShell 284 — —

Cuentas principales por volumen de eventos

Eventos de cuenta Nivel de gasto del servicio Payments-staging-0840 40 (ElastiCache) + 7 (EC2) Multi $45.3K Tier-1 DataScience-staging-6536 40 (ElastiCache) + 10 (EC2) Multi $28K Tier-1 Orders-staging-8655 39 (ElastiCache) ElastiCache $13.8K Tier-2 Analytics-production-8137 33 (ElastiCache) + 2 (EC2) Múltiple $76,7 mil Nivel-1 Logística-producción-5002 32 (ElastiCache) + 4 (EC2) Múltiple $33,9 mil Nivel-1 CustomerSupport-production-5365 30 (ElastiCache) + 1 (EC2) Múltiple $21 mil Nivel-2 DataScience-production-9480 16 (ElastiCache) + 28 (EC2) Multi $70.9K Tier-1 Payments-production-2382 21 (ElastiCache) + 17 (EC2) Multi $50K Tier-1

Nota: Una cuenta sin etiquetar (456303994757) tiene solo 327 eventos de VPN, un valor atípico enorme.

Patrones de eventos dominantes

ElastiCache UPDATE_AVAILABLE: más de 2100 eventos, todos vencidos (fechas límite a partir de septiembre de 2024). Se trata de un retraso en la aplicación de parches, no de nuevos incidentes. VPN REDUNDANCY_LOSS: 647 eventos en 14 cuentas. Fallas recurrentes en un solo túnel. EC2 INSTANCE_STOP_SCHEDULED / JUBILACIÓN: 351 eventos. Mantenimiento del ciclo de vida de la instancia. Las actualizaciones de mantenimiento dominan en 2447 eventos (52% de todos los eventos).

Cambios arquitectónicos para reducir eventos recurrentes

1. ElastiCache: automatización de parches (elimina ~2100 eventos)

Esta es la mayor victoria. Casi todos los eventos de ElastiCache están UPDATE_AVAILABLE con fechas límite a partir de septiembre de 2024, con más de 19 meses de retraso.

Habilite la actualización automática de versiones menores en todos los clústeres de ElastiCache Establezca ventanas de mantenimiento durante períodos de poco tráfico Utilice IaC (Terraform/CloudFormation) para aplicar auto_minor_version_upgrade = true como valor predeterminado en todas las cuentas Implemente reglas de AWS Config para detectar clústeres con la actualización automática deshabilitada

2. VPN: corrige la arquitectura de un solo túnel (elimina ~647 eventos)

Todos los eventos de VPN son REDUNDANCY_LOSS, lo que significa que las conexiones se ejecutan en un único túnel en lugar de dos. Solo la cuenta 456303994757 tiene 327 eventos.

Verifique que ambos túneles VPN estén activos en cada conexión VPN de sitio a sitio de AWS. Migre a AWS Transit Gateway para obtener conectividad centralizada y redundante en lugar de conexiones VPN por VPC. Implemente comprobaciones de estado en ambos túneles con conmutación por error automática. Considere AWS Direct Connect con respaldo de VPN para cuentas críticas.

3. EC2: Pasar a computación administrada/en contenedores (reduce ~351 eventos)

Los eventos EC2 están dominados por retiros de instancias, paradas programadas y reinicios de mantenimiento, todos inherentes a la gestión de instancias individuales.

Migre cargas de trabajo sin estado a ECS en AWS Fargate o EKS. AWS maneja el mantenimiento del host de manera transparente. Utilice grupos de Auto Scaling con actualización de instancias para las cargas de trabajo restantes de EC2 para que las retiradas se gestionen automáticamente. Reemplace las instancias de larga ejecución con arquitecturas compatibles con Spot utilizando políticas de instancias mixtas. Habilite la recuperación automática de EC2 y verifique que esté activada en todas partes.

4. Transversales: Higiene operativa

Etiquetar todas las cuentas: más de 100 cuentas se muestran como “N/A” sin etiquetas, lo que hace imposible la clasificación. Automatizar la respuesta a eventos de salud con reglas de EventBridge que activan funciones Lambda para tipos de eventos comunes. Consolidar cuentas: la acumulación de parches de ElastiCache abarca 140 cuentas, lo que sugiere clústeres huérfanos o sobreaprovisionados en entornos de desarrollo/sandbox. Auditar y desmantelar los recursos no utilizados.

Orden de prioridad

Parches automáticos de ElastiCache: menor esfuerzo, mayor reducción de eventos (más de 2100 eventos) Redundancia del túnel VPN: soluciona un riesgo de disponibilidad real. Etiquetado de cuentas: permite una clasificación y propiedad adecuadas EC2 → migración informática administrada: a más largo plazo, pero elimina toda una clase de eventos de mantenimiento

Tutorial de implementación

Chaplin ofrece dos opciones de implementación para satisfacer las necesidades de su equipo. Ambos están completamente programados: clona el repositorio y sigue la configuración guiada en el archivo README.

Opción A: instalación local: ejecuta el servidor MCP en su máquina y se conecta directamente a DynamoDB y Bedrock utilizando sus credenciales locales de AWS. Lo mejor para desarrolladores individuales o evaluación rápida. Los botones de instalación con un solo clic están disponibles en el repositorio de Kiro IDE, Cursor y VS Code.
Opción B: Implementación remota (Lambda): implementa el servidor MCP como una función Lambda en su cuenta de AWS. Los miembros del equipo se conectan a través de un proxy local liviano: no se necesitan dependencias locales y una única instancia del servidor está alojada en una ubicación central. Lo mejor para implementaciones en todo el equipo.

Ambas opciones implementan la infraestructura de backend (tabla DynamoDB, Lambda de S3 a DynamoDB y notificaciones de eventos de S3) y configuran su cliente MCP automáticamente.

Una vez implementado, abra su asistente de IA compatible con MCP y verifique que las herramientas de salud de Chaplin estén disponibles. Pruebe con una consulta sencilla como "¿Cuáles son los eventos de cambio programado: mantenimiento planificado y cambios?" para confirmar que la conexión está funcionando.

canalización de datos

Chaplin requiere datos de AWS Health Events. Puede implementar Chaplin antes o después de configurar la canalización de datos. La canalización de datos admite dos modelos de implementación:

Opción 1: AWS Organizations: implementación masiva en varias cuentas (recomendado)
Opción 2: Cuentas individuales: implementación manual en cuentas específicas

Para obtener instrucciones de implementación paso a paso y configuración de canalización de datos, consulte el repositorio de Chaplin en GitHub.

Beneficios e impacto

Las organizaciones que implementan Chaplin experimentan mejoras mensurables en tres dimensiones de la gestión de eventos de AWS Health: eficiencia operativa, optimización de costos y mitigación de riesgos.

Desde una perspectiva de eficiencia operativa, Chaplin permite una gestión proactiva del ciclo de vida de la tecnología al identificar las próximas migraciones y desusos con 60 a 90 días de anticipación, lo que reduce la lucha contra incendios de emergencia. La categorización automatizada de eventos reduce la carga de clasificación manual de los equipos de operaciones. El análisis de autoservicio elimina la dependencia de los TAM para el análisis de rutina, lo que permite la planificación de soluciones el mismo día. Los equipos también se benefician de la identificación temprana de servicios y configuraciones obsoletos, lo que evita la acumulación de deuda técnica.

La optimización de costos proviene de múltiples ángulos. Mantenerse al día con los cambios del ciclo de vida evita costosas migraciones de emergencia y tarifas de soporte extendido. El enfoque de procesamiento de patrones primero minimiza los costos de inferencia de IA al enrutar la mayoría de los eventos a través de una clasificación basada en reglas en lugar de llamadas LLM. Las capacidades de autoservicio reducen la participación de TAM para consultas de rutina, y una mejor visibilidad de los eventos que impactan los costos permite la identificación proactiva de los vencimientos de las instancias reservadas y los cambios de capacidad. Las políticas de retención configurables de Amazon S3 ayudan a administrar los costos de almacenamiento a lo largo del tiempo.

Para mitigar los riesgos, Chaplin proporciona visibilidad temprana de la seguridad mediante la identificación proactiva de parches de seguridad y vulnerabilidades antes de que sean explotadas. El monitoreo automatizado de eventos de salud relacionados con el cumplimiento con pistas de auditoría respalda el seguimiento del cumplimiento. El análisis contextual del impacto de los eventos en los sistemas de producción ayuda a prevenir interrupciones, y la detección de problemas de configuración y deficiencias arquitectónicas detecta los problemas antes de que causen incidentes.

De cara al futuro: del análisis de autoservicio a las operaciones autónomas con AWS DevOps Agent

Si bien la versión actual se centra en el análisis conversacional y las capacidades de autoservicio, la visión a largo plazo de Chaplin se extiende hacia operaciones autónomas. Dado que Chaplin se basa en MCP, se integra naturalmente con AWS DevOps Agent, un agente de frontera que investiga incidentes de forma autónoma, identifica las causas fundamentales y proporciona planes de mitigación detallados. Al registrar el servidor MCP de Chaplin como proveedor de capacidades en un espacio de agentes de AWS DevOps, los equipos de operaciones obtienen inteligencia de eventos de salud directamente dentro de sus flujos de trabajo de respuesta a incidentes. AWS DevOps Agent puede correlacionar los datos de eventos de salud de Chaplin con la topología de la aplicación, la telemetría y el historial de implementación para revelar el alcance del impacto, priorizar la remediación y coordinar la respuesta a través de canales como Slack y ServiceNow.

Esta integración crea un poderoso circuito de retroalimentación. Cuando AWS DevOps Agent investiga un incidente, puede consultar a Chaplin para determinar si un evento de salud relacionado (como el próximo retiro de una instancia o la obsolescencia del servicio) está contribuyendo al problema. El análisis del alcance del impacto de Chaplin proporciona un contexto empresarial, mostrando qué cuentas y cargas de trabajo están en riesgo y su gasto asociado, mientras que AWS DevOps Agent lo asigna a recursos de aplicaciones específicos y sus dependencias a través de su gráfico de topología. Juntos, permiten una clasificación automatizada donde los eventos de salud no solo se clasifican sino que se correlacionan con el estado de la infraestructura en tiempo real, lo que ayuda a los equipos a pasar de la extinción de incendios reactiva a la prevención proactiva de incidentes. A medida que AWS Health introduzca capacidades nativas de priorización, este canal se enriquecerá aún más, permitiendo a los clientes definir sus propias reglas de priorización enriquecidas tanto con metadatos de eventos de salud como con telemetría operativa.

Las mejoras futuras se basarán en esta base con mantenimiento predictivo a través de análisis de patrones de eventos y flujos de trabajo de remediación guiados con capacidades de reversión, transformando a los equipos de operaciones de respondedores reactivos a orquestadores estratégicos.

Conclusión

En esta publicación, mostramos cómo crear una solución de análisis de eventos de salud de AWS de autoservicio utilizando IA agente impulsada por Amazon Bedrock, entregada a través del Protocolo de contexto modelo (MCP). Chaplin (Nexus de inteligencia de ciclo de vida planificado y salud del cliente) demuestra un cambio del monitoreo estático de un panel de control al análisis conversacional proactivo al combinar la precisión de la consulta de datos estructurados con la comprensión contextual del análisis impulsado por IA, accesible directamente desde su asistente de IA.

Para comenzar, clone el repositorio de Chaplin GitHub e implemente la opción A (instalación local) para una evaluación rápida con sus propios datos de AWS Health. Una vez que se esté ejecutando, intente consultar los próximos eventos del ciclo de vida o profundizar en categorías de servicios específicas. Comparta su experiencia y preguntas en los comentarios a continuación.

Próximos pasos

Más información

Si tiene preguntas y comentarios, visite AWS re:Post o comuníquese con AWS Support.

Sobre los autores

Aurelio De Simone

Aurelio De Simone

Aurelio DeSimone es gerente de soporte empresarial en Amazon Web Services, donde dirige los gerentes técnicos de cuentas para el distrito de nativos digitales dentro de las cuentas estratégicas de AWS. Ayuda a los clientes más importantes de AWS a acelerar su proceso de adopción de la IA mediante liderazgo práctico y orientación técnica. Antes de AWS, Aurelio dirigió equipos de infraestructura y seguridad en múltiples empresas comerciales y de tecnología financiera en Chicago. En su tiempo libre, le gusta jugar con nuevas tecnologías y perseguir a sus hijos por la casa.

Chitresh Saxena

Chitresh Saxena

Chitresh es un especialista senior en IA/ML, que se especializa en soluciones de IA generativa y se dedica a ayudar a los clientes a adoptar AI/ML con éxito en AWS. Se destaca por comprender las necesidades de los clientes y brinda orientación técnica para crear, lanzar y escalar soluciones de inteligencia artificial que resuelvan problemas comerciales complejos.

mike dennis

mike dennis

Mike es especialista senior en IA/ML en Amazon Web Services. Aplica su profunda experiencia en el campo para ayudar a los clientes empresariales a adoptar con éxito las mejores prácticas y capacidades de IA/ML de AWS. A Mike le encanta leer libros, viajar por el mundo y experimentar nuevas culturas y cocinas.