En un típico lunes por la mañana, un equipo de operaciones empresariales recibe múltiples notificaciones de AWS Health sobre el fin de vida útil de Amazon Linux 2, la desactivación de la versión de RDS y el retiro de instancias EC2 en más de 50 cuentas. Sin análisis de autoservicio, el equipo no tiene forma de identificar rápidamente los eventos que afectan los sistemas de producción, los eventos que requieren acción inmediata versus planificación a largo plazo y el impacto comercial de cada categoría de evento.
Los equipos de operaciones también pasan tiempo esperando a que los administradores técnicos de cuentas (TAM) interpreten los eventos de salud, lo que añade retrasos a las decisiones operativas críticas. El resultado es que se dedica más tiempo a combatir incendios de forma reactiva que a innovar.
En esta publicación, le mostramos cómo crear Chaplin (Nexo de inteligencia de ciclo de vida planificado y salud del cliente), una solución de código abierto que utiliza agentes de IA expuestos a través del Protocolo de contexto modelo (MCP) para proporcionar análisis de eventos de salud de autoservicio. Con Chaplin, los equipos pueden hacer preguntas en lenguaje natural directamente desde asistentes de IA compatibles con MCP y recibir respuestas precisas y contextualizadas sin depender de AWS Support para análisis de rutina. Las instrucciones de implementación detalladas están disponibles en el repositorio de GitHub de Chaplin AWS Health Agentic Assistant.
El desafío: gestión reactiva de eventos de salud
Las empresas que ejecutan cargas de trabajo de producción en AWS administran un flujo constante de eventos de estado (cambios de servicio, ventanas de mantenimiento, parches de seguridad y notificaciones operativas) en docenas o cientos de cuentas. AWS Health proporciona datos completos de eventos a través de la API de AWS Health y Amazon EventBridge, pero los enfoques de gestión reactiva dejan lagunas.
Los equipos dependen de los TAM para la interpretación de eventos de salud y el análisis de impacto, lo que crea obstáculos en la toma de decisiones. Los paneles de inteligencia empresarial con esquemas predefinidos no pueden adaptarse a preguntas dinámicas ni proporcionar la información contextual que los equipos de operaciones necesitan en este momento. Los equipos de DevOps y operaciones en la nube dedican mucho tiempo a categorizar y priorizar manualmente miles de eventos de salud repartidos en múltiples cuentas y regiones. Sin una ubicación central para el análisis, es difícil evaluar el impacto general, coordinar respuestas entre equipos o identificar oportunidades proactivas, como planificar migraciones o programar el mantenimiento antes de que los problemas se vuelvan críticos.
Los eventos de salud elegibles pronto se vincularán directamente a las plantillas de AWS Transform, lo que permitirá a los clientes actuar directamente en los eventos. Chaplin puede sacar a la luz y priorizar estos eventos procesables para su entorno.
Descripción general de la solución: análisis de autoservicio con Chaplin
Chaplin implementa análisis de eventos de salud de autoservicio utilizando IA agente impulsada por Amazon Bedrock, entregada a través del Protocolo de contexto modelo (MCP). En lugar de esquemas de paneles predefinidos, Chaplin expone herramientas impulsadas por IA que los clientes compatibles con MCP pueden consumir. Los equipos interactúan con Chaplin directamente desde su asistente de IA (como Claude Code o Kiro CLI) y hacen preguntas en lenguaje natural. Por ejemplo, un miembro del equipo podría solicitar los próximos eventos del ciclo de vida de RDS en los próximos 60 días, solicitar un resumen de los eventos EC2 abiertos priorizados por urgencia, consultar parches de seguridad que afectan los entornos de producción o verificar qué ventanas de mantenimiento podrían afectar las aplicaciones de alta prioridad.
Sus equipos pueden continuar realizando consultas hasta que tenga toda la información necesaria para tomar una decisión informada y elaborar un plan de remediación. Este enfoque permite a los equipos de DevOps, seguridad y operaciones analizar de forma independiente eventos de salud, planificar migraciones y evaluar los impactos operativos sin crear cuellos de botella. Debido a que Chaplin usa MCP, los equipos también pueden combinarlo con otras herramientas habilitadas para MCP (como JIRA, GitHub o ServiceNow) en su flujo de trabajo para realizar acciones con experiencia de agente.
Además, MCP permite la asociación directa de datos y metadatos de AWS con el contexto a nivel empresarial o de aplicación, como etiquetas de recursos, clasificaciones de entorno e información de propiedad, lo que enriquece el análisis de eventos de salud con relevancia organizacional.
Cómo la IA agente unifica datos estructurados y no estructurados
Chaplin utiliza una arquitectura de múltiples agentes que aborda un desafío fundamental en el análisis de datos empresariales: combinar eficazmente el procesamiento de datos estructurados y no estructurados. Los sistemas tradicionales de recuperación-generación aumentada (RAG) y los enfoques de IA generativa enfrentan una limitación crítica: son inherentemente no deterministas cuando manejan operaciones numéricas y agregaciones. La búsqueda de similitud de vectores, la base de RAG, recupera contenido semánticamente similar pero no puede garantizar la precisión matemática. Cuando se les pide que cuenten, sumen o agreguen datos, los sistemas basados en RAG pueden alucinar resultados (por ejemplo, informar 190 eventos de salud relacionados con el final de la vida cuando el recuento real es 958). Este no determinismo surge de la naturaleza probabilística tanto del mecanismo de recuperación (que clasifica los documentos por similitud semántica en lugar de coincidencias exactas) como del proceso de generación del modelo de lenguaje (que predice tokens probables en lugar de calcular valores precisos).
Los eventos de AWS Health presentan exactamente este desafío. Cada evento contiene metadatos estructurados (tipo de evento, nombre de servicio, recursos afectados, marcas de tiempo, niveles de gravedad e ID de cuenta) que requieren filtrado y agregación precisos. Cada evento también contiene descripciones no estructuradas con explicaciones del problema en lenguaje natural, evaluaciones de impacto y acciones recomendadas que requieren comprensión semántica y análisis contextual.
Procesamiento inteligente de consultas
Cuando le haces una pregunta a Chaplin, tres componentes especializados trabajan juntos. El agente de lenguaje natural a consulta estructurada convierte preguntas en inglés simple en consultas precisas de datos estructurados contra metadatos de eventos de salud. Entiende el esquema de sus eventos de salud (qué campos existen, como tipo_de_evento, cuentas_afectadas y hora_de_inicio) y construye filtros que coinciden con su intención. Una pregunta como "Muéstrame las jubilaciones de EC2 en cuentas de producción" se convierte en una consulta estructurada con filtros de campo exactos en lugar de concordancia de palabras clave.
El Agente de análisis de impacto contextual maneja descripciones de eventos de salud no estructurados combinándolas con los metadatos de sus clientes: entornos de producción versus no producción, unidades de negocios, niveles de aplicaciones e información de propiedad. Este agente realiza un razonamiento a nivel de sistema, interpretando no solo lo que dice el evento sino también lo que significa para su infraestructura específica y contexto organizacional. El motor de clasificación basado en patrones clasifica los eventos de salud mediante la coincidencia de patrones basada en reglas, lo que elimina los costos de procesamiento de IA para la categorización de rutina y al mismo tiempo mantiene una alta precisión. Esta capa de optimización de costos hace que la solución sea práctica a escala.
Arquitectura de IA con costes optimizados
Chaplin implementa una optimización inteligente de costos mediante la mejora selectiva de la IA. El sistema utiliza un enfoque de procesamiento de patrones en el que la clasificación basada en reglas maneja la mayoría de los eventos sin incurrir en costos de IA. Las vistas resumidas prediseñadas para períodos de 30, 60 y 120 días con filtros ayudan a los equipos a identificar rápidamente alertas críticas. En la implementación actual, Amazon Bedrock with Claude procesa solo datos no estructurados que requieren análisis contextual. Pero la solución también es independiente del LLM y admite múltiples proveedores de modelos como Amazon Bedrock, OpenAI, Anthropic o modelos locales como Ollama, lo que brinda flexibilidad según sus requisitos y limitaciones de costos. El almacenamiento en caché inteligente reduce el procesamiento redundante de IA y la precisión de las consultas estructuradas utiliza el esquema de la API de AWS Health para un análisis numérico exacto sin costos de inferencia de IA.
Descripción general de la arquitectura
El siguiente diagrama ilustra la arquitectura Chaplin completa. Muestra cómo los eventos de salud fluyen desde múltiples cuentas de AWS a través de un canal de datos centralizado, hacia un servidor MCP impulsado por agentes de IA creados en Amazon Bedrock y, finalmente, hacia asistentes de IA compatibles con MCP donde los equipos interactúan con los datos a través del lenguaje natural. Cada capa se describe en detalle después del diagrama.
Figura 1: Arquitectura Chaplin que muestra un sistema de tres capas con recopilación de datos de múltiples cuentas, servidor MCP impulsado por IA con agentes de Amazon Bedrock e integración de cliente MCP”.
La arquitectura consta de tres capas principales que trabajan juntas para ofrecer análisis inteligentes de eventos de salud.
1. Capa de datos: capa de recopilación (varias cuentas)
El nivel de datos recopila eventos de salud de toda su organización de AWS y los centraliza para su análisis. En cada cuenta de miembro, la API de AWS Health actúa como fuente de eventos de salud. Amazon EventBridge proporciona activadores controlados por eventos para captura en tiempo real, y las funciones del recopilador de AWS Lambda recuperan eventos mediante roles de IAM entre cuentas configurados con acceso con privilegios mínimos.
Estos eventos fluyen a una cuenta de administración centralizada donde un lago de datos de Amazon Simple Storage Service (Amazon S3) almacena los eventos de salud recopilados con partición inteligente por cuenta, fecha y tipo de evento. Cuando llegan nuevos eventos, las notificaciones de eventos de S3 activan una función de AWS Lambda que procesa los eventos de estado JSON y los carga en Amazon DynamoDB para realizar consultas rápidas.
Esta arquitectura de cuentas múltiples admite dos modelos de implementación:
Opción 1: API de AWS Organizations para una implementación centralizada y automatizada en sus cuentas. Opción 2: Implementaciones de cuentas individuales para organizaciones con restricciones de seguridad.
2. Nivel medio: servidor MCP y capa de inteligencia
El nivel medio es donde los datos de eventos de salud sin procesar se transforman en inteligencia procesable y se exponen a través de un servidor MCP. Amazon DynamoDB sirve como almacén de datos principal para metadatos de eventos de salud estructurados, optimizado para consultas rápidas con índices sobre tipo de evento, gravedad, fecha y cuenta. Esto permite el acceso en tiempo real tanto para la clasificación basada en patrones como para el análisis de IA.
Un clasificador de eventos basado en patrones proporciona la primera capa de inteligencia. Este motor de categorización basado en reglas utiliza patrones de expresiones regulares en tipos de eventos para asignar eventos a cinco categorías comerciales: requisitos de migración, seguridad y cumplimiento, mantenimiento y actualizaciones, eventos de impacto en los costos y notificaciones operativas. Debido a que la mayoría de los eventos siguen patrones predecibles, este enfoque procesa la mayoría de los eventos mediante una coincidencia de patrones eficiente sin incurrir en costos de IA.
Para eventos que requieren un análisis más profundo, el motor de análisis impulsado por IA creado en Amazon Bedrock se hace cargo. Este motor utiliza el marco Strands Agents, un marco agente de código abierto desarrollado por AWS, con Claude 4.5 Sonnet como modelo de lenguaje grande. Puede cambiar esto a un LLM preferido de su elección. Tres agentes especializados manejan diferentes aspectos del análisis: un Agente de consultas SQL convierte consultas de lenguaje natural en consultas estructuradas de DynamoDB para un análisis numérico preciso, un Agente de análisis de impacto evalúa descripciones de eventos no estructurados con respecto a los metadatos del cliente, como el entorno, la unidad de negocios y la propiedad, y un Agente DBQueryBuilder genera consultas de bases de datos optimizadas para agregaciones multidimensionales. Todas estas capacidades están expuestas como herramientas MCP que los clientes compatibles pueden invocar.
3. Nivel de presentación – Cliente MCP – Integración del asistente de IA
El nivel de presentación consta de un asistente de IA compatible con MCP, como Claude Code o Kiro CLI. En lugar de una interfaz personalizada, Chaplin expone sus capacidades como herramientas MCP que estos clientes consumen de forma nativa. Los usuarios interactúan a través del lenguaje natural en su entorno de desarrollo existente, y el asistente de IA organiza llamadas al servidor MCP de Chaplin para recuperar datos de eventos de salud, ejecutar análisis impulsados por IA y presentar resultados contextualizados, todo dentro de la misma interfaz conversacional que ya utilizan para las tareas de desarrollo.
La seguridad depende de AWS Identity and Access Management (AWS IAM) para la autenticación y autorización. El cliente MCP monta las credenciales de AWS como de solo lectura y el acceso se controla mediante roles de IAM con principios de privilegios mínimos. Los datos se cifran con TLS 1.2+ en tránsito y AES-256 en reposo, y AWS CloudTrail proporciona registros de auditoría para llamadas API.
Capacidades clave
Chaplin proporciona tres capacidades principales que abordan las brechas en la forma en que las organizaciones administran los eventos de AWS Health en la actualidad.
Chaplin ofrece análisis conversacional dinámico. Genera información procesable a pedido basada en sus preguntas específicas, proporcionando desgloses precisos con recuentos exactos, cuentas afectadas y análisis contextual, generados dinámicamente dentro de su asistente de IA sin informes ni paneles prediseñados. Chaplin ofrece esto a través de tres capacidades integradas:
Herramientas de inteligencia sanitaria impulsadas por MCP
Chaplin expone un conjunto completo de herramientas MCP organizadas en tres categorías. Las herramientas de resumen consultan DynamoDB directamente y regresan instantáneamente, proporcionando recuentos de alto nivel por servicio, estado, categoría y región. Las herramientas de detalles le permiten profundizar en categorías de eventos específicos, tipos de eventos o listas de eventos filtrados. Las herramientas de análisis de IA utilizan Strands Agents con Amazon Bedrock para interpretar sus consultas en lenguaje natural, obtener datos relevantes y generar información contextual.
Canalización de datos de múltiples cuentas
Chaplin recopila eventos de salud de sus cuentas de AWS y centraliza los datos en Amazon S3, lo que admite modelos de implementación flexibles basados en su postura de seguridad. La canalización de datos consta de funciones de AWS Lambda para la ingesta automatizada de eventos de salud, programadores de Amazon EventBridge con frecuencia de recopilación configurable (diaria o por hora), roles de IAM entre cuentas para la recopilación segura de datos de múltiples cuentas con principios de privilegios mínimos, un lago de datos de Amazon S3 con partición para consultas eficientes y administración automatizada del ciclo de vida con políticas de retención configurables.
Procesamiento analítico preciso
Chaplin combina el procesamiento de datos estructurados y no estructurados para un análisis integral. Para datos estructurados, ofrece resultados numéricos exactos que incluyen recuentos y distribuciones de eventos, análisis de línea de tiempo con detección de tendencias, agregaciones multidimensionales en dimensiones de cuentas, servicios y gravedad, y desgloses categóricos con porcentajes precisos. Para datos no estructurados, proporciona información contextual, como evaluación de impacto basada en descripciones de eventos, identificación de deficiencias arquitectónicas, correlación de riesgos entre eventos relacionados y acciones recomendadas según el contexto del evento.
Tutorial de implementación: gestión del ciclo de vida de instancias EC2
Para ilustrar la amplitud de lo que Chaplin puede hacer, el siguiente tutorial muestra una serie de consultas en lenguaje natural realizadas a través de Kiro CLI. Estos ejemplos están organizados por caso de uso, desde obtener una descripción general operativa rápida hasta profundizar en servicios específicos y planificar la remediación.
Nota: Los siguientes ejemplos utilizan datos de muestra para ilustrar las capacidades de Chaplin. Sus respuestas reales variarán según los eventos de salud en su entorno de AWS.
Obtener una imagen operativa
Un equipo que comienza su día puede evaluar rápidamente el estado actual de los eventos de salud en sus cuentas e identificar qué necesita atención inmediata:
Profundizando en servicios y eventos específicos
Una vez que el equipo identifica áreas de preocupación, pueden profundizar en servicios específicos, categorías de eventos o vistas filtradas.
Por ejemplo, al preguntar sobre los cambios programados se obtiene un desglose detallado por servicio, estado y cronograma:
Análisis y planificación de remediación impulsados por IA
Cada una de estas consultas demuestra una faceta diferente de las capacidades de Chaplin: búsquedas estructuradas instantáneas desde DynamoDB para obtener resúmenes operativos, desgloses filtrados por servicio, región o tipo de evento, y análisis contextual impulsado por IA que genera información y recomienda pasos de remediación específicos. Debido a que esto se ejecuta en un asistente de IA compatible con MCP, la conversación es fluida: cada respuesta conduce naturalmente a la siguiente pregunta y los equipos pueden combinar Chaplin con otras herramientas de MCP en la misma sesión.
El siguiente ejemplo demuestra cómo Chaplin combina múltiples herramientas MCP para responder una pregunta analítica compleja. Cuando se le pregunta sobre eventos de salud recurrentes y remediación arquitectónica, el agente de IA organiza llamadas a get_health_summary, get_event_categories, get_estimated_blast_radius y get_event_type_stats para producir una respuesta integral:
Tutorial de implementación
Chaplin ofrece dos opciones de implementación para satisfacer las necesidades de su equipo. Ambos están completamente programados: clona el repositorio y sigue la configuración guiada en el archivo README.
Opción A: instalación local: ejecuta el servidor MCP en su máquina y se conecta directamente a DynamoDB y Bedrock utilizando sus credenciales locales de AWS. Lo mejor para desarrolladores individuales o evaluación rápida. Los botones de instalación con un solo clic están disponibles en el repositorio de Kiro IDE, Cursor y VS Code.
Opción B: Implementación remota (Lambda): implementa el servidor MCP como una función Lambda en su cuenta de AWS. Los miembros del equipo se conectan a través de un proxy local liviano: no se necesitan dependencias locales y una única instancia del servidor está alojada en una ubicación central. Lo mejor para implementaciones en todo el equipo.
Ambas opciones implementan la infraestructura de backend (tabla DynamoDB, Lambda de S3 a DynamoDB y notificaciones de eventos de S3) y configuran su cliente MCP automáticamente.
Una vez implementado, abra su asistente de IA compatible con MCP y verifique que las herramientas de salud de Chaplin estén disponibles. Pruebe con una consulta sencilla como "¿Cuáles son los eventos de cambio programado: mantenimiento planificado y cambios?" para confirmar que la conexión está funcionando.
canalización de datos
Chaplin requiere datos de AWS Health Events. Puede implementar Chaplin antes o después de configurar la canalización de datos. La canalización de datos admite dos modelos de implementación:
Opción 1: AWS Organizations: implementación masiva en varias cuentas (recomendado)
Opción 2: Cuentas individuales: implementación manual en cuentas específicas
Para obtener instrucciones de implementación paso a paso y configuración de canalización de datos, consulte el repositorio de Chaplin en GitHub.
Beneficios e impacto
Las organizaciones que implementan Chaplin experimentan mejoras mensurables en tres dimensiones de la gestión de eventos de AWS Health: eficiencia operativa, optimización de costos y mitigación de riesgos.
Desde una perspectiva de eficiencia operativa, Chaplin permite una gestión proactiva del ciclo de vida de la tecnología al identificar las próximas migraciones y desusos con 60 a 90 días de anticipación, lo que reduce la lucha contra incendios de emergencia. La categorización automatizada de eventos reduce la carga de clasificación manual de los equipos de operaciones. El análisis de autoservicio elimina la dependencia de los TAM para el análisis de rutina, lo que permite la planificación de soluciones el mismo día. Los equipos también se benefician de la identificación temprana de servicios y configuraciones obsoletos, lo que evita la acumulación de deuda técnica.
La optimización de costos proviene de múltiples ángulos. Mantenerse al día con los cambios del ciclo de vida evita costosas migraciones de emergencia y tarifas de soporte extendido. El enfoque de procesamiento de patrones primero minimiza los costos de inferencia de IA al enrutar la mayoría de los eventos a través de una clasificación basada en reglas en lugar de llamadas LLM. Las capacidades de autoservicio reducen la participación de TAM para consultas de rutina, y una mejor visibilidad de los eventos que impactan los costos permite la identificación proactiva de los vencimientos de las instancias reservadas y los cambios de capacidad. Las políticas de retención configurables de Amazon S3 ayudan a administrar los costos de almacenamiento a lo largo del tiempo.
Para mitigar los riesgos, Chaplin proporciona visibilidad temprana de la seguridad mediante la identificación proactiva de parches de seguridad y vulnerabilidades antes de que sean explotadas. El monitoreo automatizado de eventos de salud relacionados con el cumplimiento con pistas de auditoría respalda el seguimiento del cumplimiento. El análisis contextual del impacto de los eventos en los sistemas de producción ayuda a prevenir interrupciones, y la detección de problemas de configuración y deficiencias arquitectónicas detecta los problemas antes de que causen incidentes.
De cara al futuro: del análisis de autoservicio a las operaciones autónomas con AWS DevOps Agent
Si bien la versión actual se centra en el análisis conversacional y las capacidades de autoservicio, la visión a largo plazo de Chaplin se extiende hacia operaciones autónomas. Dado que Chaplin se basa en MCP, se integra naturalmente con AWS DevOps Agent, un agente de frontera que investiga incidentes de forma autónoma, identifica las causas fundamentales y proporciona planes de mitigación detallados. Al registrar el servidor MCP de Chaplin como proveedor de capacidades en un espacio de agentes de AWS DevOps, los equipos de operaciones obtienen inteligencia de eventos de salud directamente dentro de sus flujos de trabajo de respuesta a incidentes. AWS DevOps Agent puede correlacionar los datos de eventos de salud de Chaplin con la topología de la aplicación, la telemetría y el historial de implementación para revelar el alcance del impacto, priorizar la remediación y coordinar la respuesta a través de canales como Slack y ServiceNow.
Esta integración crea un poderoso circuito de retroalimentación. Cuando AWS DevOps Agent investiga un incidente, puede consultar a Chaplin para determinar si un evento de salud relacionado (como el próximo retiro de una instancia o la obsolescencia del servicio) está contribuyendo al problema. El análisis del alcance del impacto de Chaplin proporciona un contexto empresarial, mostrando qué cuentas y cargas de trabajo están en riesgo y su gasto asociado, mientras que AWS DevOps Agent lo asigna a recursos de aplicaciones específicos y sus dependencias a través de su gráfico de topología. Juntos, permiten una clasificación automatizada donde los eventos de salud no solo se clasifican sino que se correlacionan con el estado de la infraestructura en tiempo real, lo que ayuda a los equipos a pasar de la extinción de incendios reactiva a la prevención proactiva de incidentes. A medida que AWS Health introduzca capacidades nativas de priorización, este canal se enriquecerá aún más, permitiendo a los clientes definir sus propias reglas de priorización enriquecidas tanto con metadatos de eventos de salud como con telemetría operativa.
Las mejoras futuras se basarán en esta base con mantenimiento predictivo a través de análisis de patrones de eventos y flujos de trabajo de remediación guiados con capacidades de reversión, transformando a los equipos de operaciones de respondedores reactivos a orquestadores estratégicos.
Conclusión
En esta publicación, mostramos cómo crear una solución de análisis de eventos de salud de AWS de autoservicio utilizando IA agente impulsada por Amazon Bedrock, entregada a través del Protocolo de contexto modelo (MCP). Chaplin (Nexus de inteligencia de ciclo de vida planificado y salud del cliente) demuestra un cambio del monitoreo estático de un panel de control al análisis conversacional proactivo al combinar la precisión de la consulta de datos estructurados con la comprensión contextual del análisis impulsado por IA, accesible directamente desde su asistente de IA.
Para comenzar, clone el repositorio de Chaplin GitHub e implemente la opción A (instalación local) para una evaluación rápida con sus propios datos de AWS Health. Una vez que se esté ejecutando, intente consultar los próximos eventos del ciclo de vida o profundizar en categorías de servicios específicas. Comparta su experiencia y preguntas en los comentarios a continuación.
Próximos pasos
Más información
Si tiene preguntas y comentarios, visite AWS re:Post o comuníquese con AWS Support.