Detección de fallas silenciosas de agentes con optimización de Amazon Bedrock AgentCore

Si está operando agentes de IA a escala, Amazon Bedrock AgentCore muestra una categoría de información que probablemente haya experimentado pero que le cuesta detectar: ​​sus paneles se muestran en verde en todos los ámbitos. Tasa de finalización del 99 %, latencia saludable, cero picos de error. Y, sin embargo, siguen llegando quejas de los clientes sobre resultados incorrectos.

Una modificación de orden que en realidad nunca se ejecutó. Un producto informado como "en stock" cuando se agotó el tiempo de espera de la API de inventario. Un paso de aprobación que se saltó. Se trata de fallos de comportamiento y se ven diferentes de los problemas de infraestructura. Se completan con éxito desde la perspectiva del sistema. Pasan controles de estado y solo emergen a través de escalaciones de clientes, a menudo semanas después de que comenzaron a afectar a los usuarios a escala.

Incluso para las fallas que producen señales de error, existe un desafío aparte: cuando un agente que atiende miles de sesiones diarias acumula cientos de errores, ¿cuáles merecen atención primero? La revisión de rastros individuales revela lo que sucedió en una sola sesión. Pero le dice poco acerca de si está observando un patrón que afecta el 30% del tráfico o un caso límite que afecta a tres sesiones.

La optimización de Amazon Bedrock AgentCore proporciona información que lo ayuda a descubrir, explicar y priorizar fallas de comportamiento en sus agentes de IA implementados, incluidos los silenciosos que nunca generan una señal de error. Estos conocimientos cambian el modelo de observabilidad de la inspección reactiva de trazas a la detección proactiva de patrones. Le ayuda a encontrar fallas, comprender su alcance y solucionarlas en orden de prioridad. En esta publicación, analizamos cómo funciona la información sobre la optimización de AgentCore, cómo configurarla y qué revela cuando se dirige a un agente real.

Qué información ofrece la optimización de Amazon Bedrock AgentCore

Los insights operan una capa por encima de su pila de observabilidad existente. Consume los datos de seguimiento que sus herramientas ya recopilan y los transforma en inteligencia conductual procesable. Esto proporciona una capacidad de investigación que le ayuda a comprender patrones más amplios que afectan el rendimiento de los agentes a escala, más allá de los fallos de sesiones individuales.

La siguiente figura muestra el análisis de un extremo a otro realizado por AgentCore para brindar información valiosa. Cada método de análisis de sesión extrae uno o más atributos de cada sesión. Los atributos de cada método de análisis de sesión se agrupan de forma independiente. Cada grupo se resume para mejorar la interpretabilidad.

El informe de conocimientos muestra lo siguiente:

Descubrimiento de patrones de falla clasificados con análisis de causa raíz.
Surfaces clasificó grupos en cientos de sesiones sin requerir categorías o filtros predefinidos. Una explicación agregada por grupo que cubra las sesiones afectadas, lo suficientemente específica como para actuar sin abrir rastros individuales. Los patrones están ordenados por proporción de sesiones afectadas, por lo que un problema pertinente se distingue inmediatamente de un caso límite. Sin esto, los desarrolladores clasifican los errores según sus instintos y no pueden distinguir un problema sistemático sin revisar manualmente cientos de rastros. Análisis de la intención del usuario.
Revela cómo los usuarios interactúan con el agente en diferentes escenarios. Los agentes en producción a menudo reciben solicitudes que divergen de su diseño previsto. El análisis de intención le muestra la distribución real de lo que piden los usuarios. Muestra lagunas de cobertura que abordar y límites de alcance que aplicar, sin necesidad de instrumentar nada más allá de los rastros que ya recopila. Información sobre la ejecución.
Revela cómo responde el agente en diferentes escenarios. Los conocimientos de ejecución le muestran las estrategias que emplea su agente, cómo progresan las acciones durante una sesión y dónde el comportamiento real del agente difiere del diseño previsto. Esto cierra la brecha entre "para qué creamos el agente" y "lo que el agente realmente hace a escala".

Veamos ahora cada capacidad en profundidad.

Descubrimiento de patrones de falla

AgentCore analiza cada seguimiento de sesión comparándolo con una taxonomía estructurada de tipos de fallas de comportamiento. Detecta 11 categorías que incluyen alucinaciones, acciones incorrectas, violaciones de instrucciones de tareas, errores de orquestación, problemas de manejo del contexto y otras. El análisis razona sobre el cumplimiento de las políticas y la corrección del comportamiento en lugar de basarse únicamente en señales de error. Este enfoque detecta fallas silenciosas. Cada falla detectada produce una ubicación en el seguimiento, una categoría y una descripción en lenguaje natural de lo que salió mal. Luego, Insights agrupa las descripciones en grupos. Esto muestra un único patrón con nombre en cientos de sesiones, en lugar de cientos de entradas de seguimiento individuales.

La siguiente figura muestra la agrupación de fallas y el análisis de la causa raíz (canalización RCA). Identificamos fallas para cada sesión y las agrupamos en subgrupos. Para cada sesión en un subgrupo de fallas, generamos explicaciones de la causa raíz.

Agrupación de fallas y análisis de causa raíz que agrupa fallas de sesión en subclústeres con explicaciones de causa raíz por sesión

Para cada grupo de fallas, AgentCore rastrea hacia atrás a través del gráfico de ejecución para identificar qué causó la falla, no solo dónde apareció. La sesión se representa como un gráfico de intervalos (llamadas de inferencia, ejecuciones de herramientas, invocaciones de subagente) y el sistema poda las ramas no relacionadas con la falla antes de razonar sobre la causalidad. Esta poda hace que RCA sea manejable en sesiones largas al reducir un flujo de trabajo de 50 pasos a la ruta de ejecución específica que condujo al error. El resultado muestra una ubicación de la causa raíz (un ID de intervalo en sus registros), una clasificación de causalidad y una recomendación de solución (cambio de aviso del sistema, actualización de la descripción de la herramienta o trabajo de infraestructura). Luego, Insights agrupa las causas raíz dentro de un clúster. Es posible que observe que 90 de 100 fallas comparten la misma causa subyacente y el mismo tipo de solución.

La agrupación por sí sola le indica qué tipos de fallas existen. La clasificación de alcance le indica cuáles son más importantes. Cada grupo de fallas lleva un recuento de sesiones afectadas y los grupos se ordenan según ese recuento en relación con el total de sesiones analizadas. La jerarquía de dos niveles separa las categorías amplias de fallas de los subpatrones específicos.

Un clúster de nivel superior podría mostrar "El agente omite la recopilación de información" que afecta a 116 sesiones. Profundizar revela que 114 de ellos son un único subpatrón (“Recuperación de información de requisitos previos omitida”). Los 2 restantes son casos extremos no relacionados. Esta estructura significa que puede identificar inmediatamente la solución única que soluciona la mayor parte de los errores.

Análisis de la intención del usuario

Más allá de las fallas, AgentCore extrae dos vistas adicionales del comportamiento de los agentes. La agrupación de solicitudes de usuario incorpora y agrupa las indicaciones reales que los usuarios envían a su agente, revelando la distribución de los casos de uso en producción. Puede descubrir que el 40 % del tráfico es un caso de uso para el que usted diseñó. Otro 30% recibe apoyo parcial. El 30% restante es algo que nunca anticipaste.

Información sobre la ejecución

El resumen de ejecución extrae el enfoque que adoptó el agente y el resultado que alcanzó en cada sesión. Utiliza una estrategia de resumen jerárquico que maneja sesiones de diferentes duraciones. AgentCore luego agrupa estos resúmenes para revelar patrones de ejecución. Esto incluye estrategias comunes que emplea el agente, cómo esas estrategias se correlacionan con el éxito o el fracaso y dónde el comportamiento real del agente difiere del diseño previsto.

En conjunto, le brindan un mapa de comportamiento de su agente en producción que va más allá de la detección de errores y comprende cómo se utiliza el sistema y cómo responde.

Cómo configurar información en la optimización de Amazon Bedrock AgentCore

Cuando tiene un agente con su telemetría registrada en la observabilidad de Amazon Bedrock AgentCore, puede utilizar información para comprender los modos de falla, las intenciones del usuario y los resúmenes de ejecución de este agente.

Puede crear una configuración de información desde la consola de AgentCore en Optimizaciones > Información > Crear información.

Elige qué analizar

En "Información para generar", seleccione los tipos de análisis que desee:

Análisis de fallas: identifica las causas fundamentales y muestra resultados incorrectos o incompletos en todas las sesiones. Análisis de la intención del usuario: agrupa las solicitudes que los usuarios envían a su agente para que pueda ver lo que están tratando de lograr. Resumen de ejecución: extrae las acciones que realizó el agente durante cada sesión y cómo avanzaron hacia una resolución.

Puede ejecutarlos de forma independiente o juntos.

Conecte su agente

Tiene dos opciones para señalar información sobre los datos de su sesión:

Seleccione el punto final del agente: elija un agente implementado a través del tiempo de ejecución de AgentCore y el grupo de registros de Amazon CloudWatch asociado se seleccionará automáticamente. Seleccione el grupo de registros de Amazon CloudWatch: si su agente se ejecuta fuera del tiempo de ejecución de AgentCore, apunte directamente al grupo de registros donde llegan sus seguimientos.

Establecer un horario

Insights se puede configurar en dos modos:

Recurrente genera informes automáticamente según la cadencia que elijas. Puede habilitar una combinación de frecuencias de análisis diarias, semanales y mensuales. Una vez creada, Insights procesa las sesiones en segundo plano sin necesidad de realizar ninguna otra acción.

Una vez genera un informe único para un rango de tiempo específico. Úselo para revisiones posteriores a la implementación, investigaciones basadas en quejas o anomalías de métricas que desee explicar.

La casilla de verificación "Habilitar esta configuración una vez creada" (marcada de forma predeterminada) comienza a procesarse inmediatamente después de guardar.

Opcional: filtros, muestreo y permisos

Expanda "Filtros y muestreo" para analizar el alcance de criterios de sesión específicos o muestrear un subconjunto de tráfico. Expanda "Permisos" para configurar los usos de información de roles de IAM para acceder a sus registros.

Una vez configurado, elija Crear información y su primer informe estará disponible según el programa que elija.

Página de configuración de información de la consola AgentCore que muestra tipos de análisis, conexión de agentes y opciones de programación

Ver ideas en acción

Considere un agente de tendencias del mercado que proporcione análisis de inversiones, recomendaciones de acciones y datos de desempeño del sector. Después de ejecutar 10 sesiones, esto es lo que muestra cada vista de análisis de conocimientos.

Análisis de fallas

Insights identificó una categoría de falla: "Datos financieros alucinados sin invocación de herramientas", que afecta a 1 de cada 10 sesiones. El agente generó puntos de datos financieros específicos, tasas de mercado y afirmaciones numéricas y los presentó como información objetiva sin recurrir a las herramientas de recuperación de datos disponibles. Esto viola la directiva del sistema de recuperar datos reales antes de realizar reclamaciones.

La causa raíz (“Reclamaciones de datos fabricados sin invocación de herramientas”) se debe a una brecha entre los requisitos establecidos y la aplicación de la ejecución. El mensaje del sistema le dice al agente que base las respuestas en datos reales, pero carece de mecanismos de cumplimiento suficientes para exigir el uso de herramientas antes de presentar afirmaciones fácticas. El agente omite los pasos de validación de datos y presenta información no verificada como autorizada.

Este fallo no produjo ningún error. La sesión se completó con éxito. Con información valiosa, verá la causa raíz, la sesión específica afectada y un camino claro para solucionarlo: fortalecer el aviso del sistema para aplicar la invocación de herramientas antes de las reclamaciones numéricas.

Análisis de fallas de Insights que muestra el grupo de datos financieros alucinados sin invocación de herramientas que afecta a 1 de cada 10 sesiones

Análisis de la intención del usuario

Comprender lo que los usuarios le piden a su agente que haga normalmente requiere leer manualmente las transcripciones de las sesiones. El análisis de intención le brinda esta distribución automáticamente a partir de los rastros que ya recopila. Las solicitudes de los usuarios aquí se agrupan en 3 categorías, lo que revela la distribución real de lo que los usuarios le piden al agente que haga:

Recuperación de perfiles y evaluación de carteras (5/10 sesiones): los usuarios obtienen datos de carteras existentes, solicitan información personalizada del perfil de inversión o buscan recomendaciones específicas del sector basadas en su perfil de riesgo. Análisis macroeconómico y sectorial (3/10 sesiones): usuarios que preguntan sobre las condiciones más amplias del mercado y las tendencias a nivel sectorial. Comparación y análisis de múltiples acciones (2/10 sesiones): usuarios que comparan acciones específicas entre sí.

La mitad de todo el tráfico es recuperación de perfiles y carteras. Esto le indica dónde invertir primero en confiabilidad. Si las búsquedas de perfiles fallan o devuelven datos obsoletos, estás degradando la experiencia del 50% de tus usuarios.

Análisis de la intención del usuario que muestra tres grupos de solicitudes: recuperación de perfiles, análisis macroeconómico y comparación de múltiples acciones.

Resúmenes de ejecución

Usted sabe para qué fue diseñado su agente, pero tiene una visibilidad limitada de lo que hace en las sesiones a escala. Los resúmenes de ejecución cierran esa brecha. Aquí el comportamiento de los agentes del mercado se agrupa en tres patrones de ejecución:

Análisis financiero multisectorial y asignación de cartera (6/10 sesiones): el agente recupera datos de descripción general del mercado (VIX, desempeño del sector, sentimiento), analiza sectores defensivos, extrae datos de acciones individuales para nombres de primera línea (KO, PG, JNJ, UNH) y sintetiza un marco de asignación multisectorial con asignaciones porcentuales específicas y recomendaciones ajustadas al riesgo. Aclaración y recopilación de información del perfil primero (2/10 sesiones): el agente prioriza comprender el perfil del usuario antes de actuar. Análisis comparativo de múltiples acciones con IA e inteligencia sectorial (2/10 sesiones): el agente compara múltiples acciones con el contexto a nivel sectorial.

El patrón de ejecución dominante muestra al agente completando flujos de trabajo de asesoramiento completos de un extremo a otro. Los dos patrones más pequeños revelan caminos de comportamiento alternativos.

Resumen de ejecución que muestra tres patrones de ejecución de agentes en las 10 sesiones analizadas

Conclusión

La optimización de Amazon Bedrock AgentCore proporciona información cuando su agente se equivoca silenciosamente. Úselo para la validación posterior a la implementación cuando aumenten las quejas pero los paneles parezcan normales. Realice un monitoreo semanal proactivo que detecte fallas invisibles antes que los clientes. Úselo para evaluar la clasificación del alcance cuando un puñado de quejas resulten ser menos del 10% del impacto real. Ya sea que esté validando un cambio de aviso del sistema en una ventana de tiempo o rastreando quejas hasta sesiones afectadas, el flujo de trabajo es el mismo: enviar sesiones, recibir patrones clasificados, actuar sobre causas raíz específicas. Habilite información valiosa sobre la optimización de Amazon Bedrock AgentCore para su agente y vea lo que falta en sus paneles. Visite la documentación para obtener más información.

Agradecimientos: Gracias al equipo de ciencia e ingeniería que brindó esta capacidad: Sanjana Agarwal, Abhimanyu Siwach, Vincent Chen, Swarnim, Frankie Kim, Stephanie Yuan, Aron Thakur, Jaejin Cho, Muhyun Kim, Arron Bailiss, Shoaib Javed, Gitika Jha y Michael Fan.

Sobre los autores

Vivek Singh

Vivek Singh

Vivek es el líder de producto para observabilidad, evaluaciones y análisis de comportamiento en AWS AgentCore. Es responsable de los productos que permiten a los desarrolladores empresariales comprender, medir y mejorar cómo se comportan los agentes de IA en producción, cerrando la brecha entre los prototipos y los sistemas autónomos de grado de producción. Su trabajo abarca instrumentación, marcos de evaluación automatizados y herramientas de optimización que hacen que los flujos de trabajo de los agentes sean transparentes, comprobables y confiables a escala. Fuera del trabajo, practica una cantidad probablemente poco saludable de deportes (F1, ajedrez, tenis, fútbol americano universitario, fútbol), jardines y busca buenas panaderías en Seattle.

Bharathi Srinivasan

Bharathi Srinivasan

Bharathi es el lanzamiento técnico al mercado para la IA responsable en AWS, y ayuda a las organizaciones a trasladar de forma segura conceptos fronterizos de IA a entornos de producción del mundo real. Apasionada por la confiabilidad de la IA y la habilitación de los desarrolladores, publica con frecuencia investigaciones y ejemplos de códigos sobre evaluación, confiabilidad y seguridad de LLM. En su tiempo libre, le gusta explorar senderos de montaña, prepararse para aventuras en el campo y disfrutar de K-dramas.