Cuando creas soluciones de IA agentes, te enfrentas a desafíos operativos únicos. Los agentes toman decisiones impredecibles, los costos aumentan inesperadamente y la depuración de fallas no deterministas parece imposible. Las aplicaciones de IA agente no se limitan a ejecutar flujos de trabajo predeterminados. Razonan, se adaptan y toman decisiones autónomas, y las prácticas de DevOps deben adaptarse. Ahí es donde entra en juego AgentOps, la disciplina operativa para implementar, gestionar y mejorar continuamente los agentes de IA en producción.
La primera parte de nuestra serie de blogs presentó cómo poner en funcionamiento cargas de trabajo de IA generativa. En esta publicación, mostramos cómo acelerar el camino hacia la producción para cargas de trabajo de IA agente, verificar la calidad de sus agentes y herramientas e impulsar la adopción de IA agente en su organización mediante la implementación de AgentOps con Amazon Bedrock AgentCore. Discutimos las mejores prácticas de implementaciones del mundo real en cuatro pilares: gobernanza y seguridad, construcción y operaciones, evaluación y observabilidad. También mostramos cómo los servicios, las personas y los procesos de AWS se combinan en una arquitectura de referencia que puede adaptar a su organización.
Tenga en cuenta que esta publicación se centra en las operaciones y no en el diseño de agentes. Los ejemplos de implementación utilizan Amazon Bedrock AgentCore y admiten servicios de AWS, pero los principios analizados se aplican de manera amplia. La arquitectura de referencia es un punto de partida: los requisitos de su organización determinarán cómo la adaptará.
AgentOps: Los cuatro pilares
Esta publicación cubre las mejores prácticas y aprendizajes del mundo real para cada uno de los pilares de AgentOps:
Gobernanza y seguridad: utilice estrategias de múltiples cuentas, controles deterministas, controles de razonamiento y participación humana para verificar que los agentes operen dentro de los límites autorizados y que cada acción sea rastreable. Compilación y operaciones: trate cada agente, herramienta y configuración de memoria como un artefacto versionado e implementable con su propia canalización de CI/CD. Evaluación: evaluar en cuatro niveles, herramienta, turno de conversación, resultado de la sesión y sistema en desarrollo y producción. Observabilidad y monitoreo: instrumento en cuatro capas de telemetría para que pueda rastrear cada decisión de los agentes, monitorear las caídas de calidad y rastrear el costo por interacción.
Amazon Bedrock AgentCore ofrece componentes que puede utilizar de forma independiente o en conjunto para implementar estos pilares. Es la plataforma Agentic AI de AWS para crear, implementar y operar agentes eficaces de forma segura a escala. AgentCore funciona con cualquier marco de código abierto y cualquier modelo de lenguaje grande (LLM) y puede realizar la transición del desarrollo local a la producción sin administrar la infraestructura.
El ciclo de vida de AgentOps en AWS
Al igual que otras soluciones de software, los agentes siguen un ciclo de vida de desarrollo desde la idea hasta la producción, y esa progresión nunca termina realmente. Los agentes requieren atención operativa continua y mejoras en cada etapa. A continuación, describimos cómo la IA agente impacta cada etapa de su proceso de DevOps: planificar, desarrollar, construir, probar, implementar y lanzar, mantener y monitorear.
Etapa DevOps Plan de consideraciones de AgentOps Evaluar la idoneidad, los riesgos y la ética de la IA. Obtenga aprobaciones legales/de cumplimiento, establezca métricas de desempeño, prepare datos. Definir el punto de supervisión humana, los permisos de las herramientas, el modelo de confianza del agente, la autenticación entre agentes, el diseño inicial del agente. Desarrollar la experimentación y la selección de modelos, las evaluaciones, la generación aumentada de recuperación (RAG)/indicaciones, las estrategias de fragmentación y las barreras de seguridad. Orquestación, memoria, estado, registro/descubrimiento de herramientas, herramientas de protocolo de contexto de modelo (MCP), agente a agente (A2A), identidad del agente, evaluaciones de agentes, patrones de autenticación Unidad de compilación/integración/seguridad/pruebas de agente, implementación en preproducción. Pruebas de flujo de trabajo, validación de cadena de herramientas. Validación del control de acceso basado en roles (RBAC) Prueba y lanzamiento Ejecute pruebas de seguridad, calidad y rendimiento de extremo a extremo. Actualice las notas de la versión con consideraciones de IA. Evaluación de rutas de ejecución, objetivos de extremo a extremo, límites de bucle, pruebas humanas en el bucle (HITL), acciones de agentes no autorizados. Implementar Implementar solución en producción. Implementar servidores y herramientas MCP. Simultaneidad, privilegios mínimos y redes para puntos finales de agentes. Configure estrategias de reversión, implementaciones canary o gestión del tráfico. Mantenga y supervise la calidad de la pista, las barreras de seguridad, la latencia, el rendimiento, la IA responsable, los errores, el uso de la pista y el costo. Comentarios de los usuarios. Monitoreo de seguimientos/intervalos, deriva, alertas, seguimientos de auditoría de acciones, detección de anomalías, barreras de seguridad para llamadas de agente de un extremo a otro
Los pilares se aplican independientemente de en qué etapa del ciclo de vida se encuentre. Desde una perspectiva de IA responsable, se necesita una gestión sistemática de riesgos en todo momento. “La Matriz de alcance de seguridad de IA agente: un marco para proteger los sistemas de IA autónomos” puede ayudar a identificar y gestionar los riesgos.
Descripción general de la solución
La siguiente arquitectura de referencia muestra cómo se conectan los pilares, el ciclo de vida, las personas, los procesos y los servicios de AWS. Repasémoslo paso a paso.
Planificación y configuración
El propietario del producto registra el caso de uso en un catálogo centralizado. Los equipos legales y de cumplimiento evalúan los riesgos y brindan orientación. Una vez que se aprueba el caso de uso, el propietario del producto trabaja con expertos en el dominio y equipos técnicos para establecer el alcance, las métricas de éxito y las indicaciones de prueba de la fuente de la verdad para su evaluación. Los ingenieros de plataformas implementan entornos utilizando IaC con controles de acceso acordados con los equipos de seguridad y etiquetado para gobernanza y seguimiento de costos.
Desarrollo
Los desarrolladores y científicos de datos crean repositorios de agentes, aplicaciones y herramientas con código semilla y comienzan a construir. Pueden utilizar herramientas aprobadas detrás de AgentCore Gateway compartido y agentes detrás del Registro de AWS. Las solicitudes de nuevas herramientas o servidores MCP pasan por el propietario del producto, el equipo de la plataforma y el departamento legal para su aprobación. Los ingenieros de datos crean conjuntos de datos y conjuntos de evaluación para desarrollo y pruebas. Los desarrolladores ejecutan evaluaciones manuales y automatizadas que incluyen precisión en la selección de herramientas, validación del razonamiento de varios pasos, coherencia de la conversación y persistencia de la memoria. Los expertos en el dominio revisan los resultados y brindan comentarios. Los resultados del experimento se rastrean localmente durante el desarrollo y luego se sincronizan con la cuenta compartida para un seguimiento centralizado y una comparación entre equipos. Los desarrolladores se fusionan con main, lo que desencadena el proceso de implementación.
Canalización de compilación e implementación
La canalización de CI/CD crea una rama de lanzamiento, implementa recursos en preproducción, incluida la implementación del agente en AgentCore Runtime a través de ECR, y activa la canalización de evaluación. Para las implementaciones de RAG, la canalización de ingesta se implementa en la cuenta de gobernanza de datos. En preproducción, se ejecutan pruebas de evaluación de integración, rendimiento, UAT, regresión y IA generativa, incluidos flujos de autenticación, propagación del contexto del usuario y validación de autorización para el acceso a herramientas. Los ingenieros de control de calidad y los expertos en el dominio validan según las métricas establecidas y aprueban la promoción a producción.
Despliegue y operaciones de producción.
La solución se implementa en producción. La telemetría de producción, los comentarios de los usuarios y las métricas de rendimiento regresan a la planificación para la mejora continua. Los agentes se registran en la API Agent Discovery, lo que los hace reconocibles para su reutilización y colaboración entre agentes. Los usuarios finales interactúan con la aplicación y brindan comentarios. Los paneles de control de AgentCore Observability rastrean los seguimientos de decisiones, los patrones de invocación de herramientas, la latencia, los errores, el uso de la memoria y el costo por interacción.
Ahora repasemos cada pilar con más detalle.
Pilar 1: Gobernanza y Seguridad
En los sistemas agentes, una solicitud de un solo usuario puede extenderse a través de cadenas jerárquicas o desencadenar enjambres colaborativos donde múltiples agentes actúan en nombre del usuario. Cada interacción entre usuario y agente debe estar estrictamente controlada. Cuando el Agente A llama al Agente B, puede haber ambigüedad sobre qué agente está autorizado a realizar qué acciones. Si un usuario con permisos limitados activa un agente, el agente debe heredar esas restricciones. Esta ambigüedad sólo se agrava en una cadena de llamadas más profunda. Necesita una gobernanza estricta sobre quién puede acceder a los agentes, a qué datos, herramientas y API pueden acceder los agentes, quién puede autorizar estos permisos y qué ocurre cuando surgen problemas.
El siguiente diagrama muestra las decisiones de seguridad que se deben tomar en cada paso cuando un agente maneja una solicitud. La entrada de un usuario fluye a través de un entorno hacia el agente, que utiliza herramientas y memoria para generar resultados. La aplicación verifica la identidad del usuario, si tiene permiso para invocar al agente y si el agente puede acceder al contexto, la memoria y las herramientas solicitados con los parámetros específicos. También valida que las entradas sean seguras y que el agente esté autorizado a devolver las salidas específicas.
Para lograr un enfoque de seguridad en capas que ayude a los agentes a operar dentro de límites bien definidos y al mismo tiempo mantener la auditabilidad, debe considerar las siguientes dimensiones.
Arquitectura multicuenta
AgentOps es una extensión de GenAIOps, de la misma manera que MLOps es una extensión de DevOps. Si siguió la Parte 1: GenAIOps, los mismos principios de diseño se aplican a AgentOps. Debe seguir una estrategia de múltiples cuentas para el aislamiento organizacional y Políticas de control de servicios (SCP) para establecer barreras de seguridad entre las cuentas.
El siguiente diagrama de referencia muestra la arquitectura de AWS de múltiples cuentas:
Una cuenta de servicios compartidos con imágenes de contenedores de Amazon Elastic Container Registry (ECR), artefactos de canalización, AWS Secrets Manager y servicios de autenticación y monitoreo centralizados. Cuentas de datos para separar las cuentas de productor de las cuentas de gobierno de datos, respaldando el aislamiento y el acceso seguro a bases de conocimiento alineadas con los requisitos de cumplimiento. Cuentas de aplicación. a. Desarrollo dedicado (dev), b. preproducción (pre-prod), y c. cuentas de producción (prod) por línea de negocio o equipo de aplicación y etiquetadas para control y seguimiento de costos.
Las cuentas y los recursos se implementan y administran mediante infraestructura como código (IaC).
Acceso controlado al modelo
Al utilizar Amazon Bedrock, usted controla a qué modelos tienen acceso las aplicaciones mediante SCP y políticas basadas en identidad de IAM. Sus agentes pueden utilizar estos modelos directamente o mediante una puerta de enlace de IA generativa como LiteLLM. Con una puerta de enlace, centraliza el control de acceso y simplifica la implementación de la gobernanza entre múltiples proveedores de modelos, al tiempo que proporciona una interfaz API unificada para limitar la velocidad por usuario o agente, presupuestación de tokens, seguimiento de costos y aplicación de presupuestos, enrutamiento de modelos basado en políticas de seguridad y pistas de auditoría centralizadas para el cumplimiento. AWS ha publicado una guía sobre cómo implementar una puerta de enlace de IA generativa. Inicialmente colocamos la puerta de enlace en servicios compartidos para simplificar, pero nos resultó más difícil atribuir costos a agentes individuales y la trasladamos a cuentas de aplicaciones.
Control de identidad y acceso
Puede utilizar AWS Identity and Access Management (IAM) para un control de acceso detallado. Además, con AgentCore Identity usted administra la autenticación y la autorización entre sus agentes, con controles de acceso detallados y protocolos de autenticación entre agentes que mantienen los límites de seguridad a medida que las solicitudes se propagan a través de su sistema. Para obtener más información, consulte Amazon Bedrock AgentCore Identity: Protección de la IA agente a escala. AWS CloudTrail se puede utilizar para registros de auditoría integrales y análisis forenses.
Gobernanza de datos
Los datos fluyen a través de múltiples puntos de contacto: entradas del usuario (texto, archivos adjuntos), instrucciones del agente, salidas, fuentes de datos a las que se accede y operaciones de memoria, cada uno de los cuales presenta riesgos potenciales de seguridad. Configure Amazon Bedrock Guardrails para evaluar las indicaciones de los usuarios y modelar las respuestas según sus políticas de seguridad y para protegerse contra amenazas como la divulgación involuntaria de PII. Para obtener instrucciones detalladas de configuración para implementar barreras de seguridad e integrarlas con una puerta de enlace de IA generativa, consulte Proteger las aplicaciones de IA generativa con Amazon Bedrock Guardrails.
Además de lo anterior, utilice el control de versiones de los conjuntos de datos de evaluación (con unos pocos cientos de ejemplos) y realice un seguimiento sistemático de los cambios en los documentos y las incorporaciones generadas dentro de las bases de conocimiento de RAG para respaldar los requisitos de evaluación y auditoría.
Memoria
En las aplicaciones agentes, los datos representan hechos subyacentes, documentos e información estructurada que los agentes consultan (bases de conocimiento, bases de datos, API) a los que se accede a través de mecanismos de recuperación como RAG, gobernados a través de controles de acceso tradicionales. Por otro lado, la memoria es el contexto de trabajo del agente (lo que retiene sobre conversaciones, preferencias de usuario y patrones de interacción). Es dinámico y conversacional, evolucionando con cada interacción.
Con AgentCore Memory obtienes memoria a corto plazo y memoria a largo plazo con estrategias integradas y personalizadas para la extracción de memoria. También puede anular la lógica de extracción o implementar estrategias autoadministradas para requisitos especializados. Los espacios de nombres, que se definen en el momento de la creación como parte de la configuración de la estrategia en la memoria a largo plazo, organizan la memoria por actor, sesión o estrategia. Proporcionan la estructura que ayuda a la personalización y el aprendizaje compartido entre los usuarios. AgentCore Memory analiza los datos en agregados individuales a nivel de actor. Cuando los agentes necesitan aprender patrones entre usuarios, la memoria puede agregarse en niveles más altos en toda la aplicación. En un patrón de implementación de múltiples cuentas, cada cuenta (desarrollador, preproducción, producción) tiene sus propios recursos de memoria AgentCore que los equipos implementan y administran junto con sus aplicaciones. Este patrón de implementación ayuda con el aislamiento de seguridad, el escalado independiente, la alineación con los requisitos de residencia de datos y la asignación de costos por aplicación.
Las aplicaciones pueden acceder a múltiples recursos de memoria. El siguiente diagrama ilustra este enfoque y muestra cómo dos aplicaciones, una de fraude y otra de reclamaciones, acceden a señales de riesgo y detalles de políticas desde sus recursos dedicados, y a los detalles del usuario desde un recurso de memoria compartida. Puede controlar a qué recursos de memoria e información tienen acceso con políticas de IAM.
Gobernanza de herramientas
Los agentes llaman a las herramientas en nombre de los usuarios, pero no todos los usuarios deben activar todas las herramientas con todos los parámetros. Puede utilizar AgentCore Gateway para controlar herramientas y transformar API, funciones Lambda y servicios en herramientas compatibles con MCP a las que se puede acceder a través de un punto final único y seguro. Funciona con AgentCore Identity para administrar tanto la autenticación entrante (verificación de la identidad del agente) como la autenticación saliente (conexión a herramientas a través de OAuth, actualización de token, almacenamiento de credenciales) para que los agentes no manejen las credenciales directamente. Usted define a qué tiempos de ejecución, herramientas y backends puede llegar el agente, aplicados por políticas de recursos/IAM e identidades de carga de trabajo. La identidad establece el perímetro y responde “quién eres” y “a qué infraestructura puedes acceder”.
La política en AgentCore intercepta las solicitudes de herramientas enrutadas a través de Gateway, evaluando las solicitudes con respecto a políticas deterministas expresadas en Cedar, el lenguaje de políticas de código abierto de AWS, antes de permitir el acceso a las herramientas. Responde: "¿Se le permite hacer esto ahora mismo?" (por ejemplo, ¿puede abrir un reclamo que supere el millón?). Obtiene una aplicación auditable en todas las interacciones de los agentes, lo que reduce el riesgo de que se eludan las políticas mediante la manipulación de los agentes.
El siguiente diagrama muestra cómo funcionan juntos los servicios anteriores. El mismo patrón se aplica a cada una de las cuentas de desarrollo, preproducción y producción.
Para ver cómo funcionan estos patrones de identidad y gobernanza a escala empresarial, vea cómo Swisscom crea IA agente para atención al cliente y ventas con Amazon Bedrock AgentCore.
Con límites de gobernanza establecidos, necesita mecanismos coherentes para crear, versionar e implementar agentes, herramientas y configuraciones de memoria en todos los entornos.
Pilar 2: Construcción y Operaciones
Los agentes dependen de infraestructura, recursos, herramientas y modelos que pueden cambiar de forma independiente. Necesita disciplina operativa para evitar que una actualización de una herramienta propiedad de otro equipo afecte a su agente o una mala configuración de la memoria que revele inadvertidamente el contexto del usuario. Trate cada componente como un artefacto versionado e implementable con su propio repositorio:
Repositorio de infraestructura: configuración de cuentas, registro de agentes, recursos (almacenes de vectores, registros de agentes y herramientas, etc.) y código semilla para componentes reutilizables. Repositorio de agentes: código de solución agente con módulos compartidos para herramientas, barreras de seguridad, políticas, indicaciones y marcos de evaluación (según el tamaño de su negocio y sus requisitos, los módulos compartidos también pueden estar en un repositorio separado). Repositorio de herramientas: código de herramienta para herramientas con su propio CI/CD, a menudo implementado detrás de un servidor MCP. Repositorio de aplicaciones: la aplicación empresarial que utiliza el agente; Varias aplicaciones pueden compartir el mismo agente.
Con esta separación, usted dispone de control de versiones, pruebas e implementación independientes, al mismo tiempo que mantiene una propiedad clara y un seguimiento de cambios. El siguiente diagrama ilustra este enfoque:
Entornos y Pipelines CI/CD para aplicaciones agentes
Los desarrolladores que trabajan en la cuenta de desarrollo clonan los repositorios con el código semilla. A medida que desarrollan su aplicación y sus agentes, modifican: 1. el código del agente, incluidos los módulos compartidos, y las plantillas de IaC para aprovisionar recursos AgentCore para los agentes, 2. almacenes de vectores que utilizan servicios como Amazon OpenSearch Serverless, Amazon S3 Vectors para incrustaciones o Amazon Aurora con pgvector, 3. canales de ingesta de datos, 4. código de aplicación que se conecta al agente 5. cambios en canales de evaluación automatizados. La combinación de sus cambios desencadena una canalización de CI/CD. Esto implementa plantillas de IaC en la cuenta de preproducción y empaqueta el código del agente y la aplicación como imágenes de contenedor enviadas a Amazon Elastic Container Registry (ECR) en los servicios compartidos o la cuenta de canalización.
En la fase previa a la producción, las pruebas automatizadas se ejecutan en siete dimensiones: integración, rendimiento, UAT, regresión, seguridad, IA agente e IA responsable. La evaluación de la IA agente incluye flujos de autenticación, propagación del contexto del usuario, validación de autorización para el acceso a herramientas y métricas de calidad específicas del agente. La evaluación de la IA agente es la más compleja y abarca múltiples dimensiones. Por ejemplo, validar que la identidad y los permisos de un usuario se propaguen correctamente a través de una cadena de múltiples agentes puede requerir la creación de configuraciones de prueba personalizadas que simulen las solicitudes que fluyen entre múltiples agentes para verificar que la identidad y los permisos se propaguen correctamente en cada paso.
Ciclo de vida del agente
Usted crea agentes en su repositorio de agentes. Usted coloca en contenedores la implementación de su agente, almacena la imagen del contenedor en ECR y la implementa en AgentCore Runtime conectándose a AgentCore Identity, recursos de AgentCore Memory y AgentCore Gateway compartido y a nivel de cuenta. Cuando esté listo para fusionar los cambios, la canalización de CI/CD empaqueta el agente como una imagen de contenedor, lo envía a ECR y lo implementa en AgentCore Runtime en la fase previa a la producción.
La canalización también registra o actualiza los metadatos del agente como un registro estructurado en AWS Agent Registry en AgentCore. Con AWS Agent Registry, tiene un lugar centralizado para descubrir, compartir y reutilizar agentes, servidores MCP, herramientas y habilidades de agentes en toda su organización. Admite la ingesta automática de metadatos desde terminales MCP y A2A y realiza un seguimiento de los registros a través de un flujo de trabajo de aprobación (borrador → pendiente → aprobado) antes de que sean reconocibles en toda la organización. Invoca a los agentes directamente o mediante A2A o como objetivos detrás de un servidor MCP. En preproducción, ejecuta pruebas automatizadas antes de la promoción a producción. Las plantillas de IaC en el repositorio de infraestructura definen el tiempo de ejecución, los recursos de memoria y las funciones de IAM para una infraestructura coherente en todos los entornos.
Cada AgentCore Runtime mantiene versiones inmutables automáticamente. Puede crear alias de puntos finales (como DEV, PREPROD y PROD) que apunten a versiones específicas, para implementar promoción independiente, reversión instantánea y administración de versiones dentro de su flujo de trabajo de implementación.
Etiquete a cada agente con el propietario, el centro de costos y el ID del caso de uso, y utilice AWS CloudTrail para realizar seguimientos de auditoría.
Ciclo de vida de la herramienta
Los agentes invocan herramientas directamente (para capacidades integradas), a través de puntos finales de AgentCore Gateway en la misma cuenta, o mediante puntos finales compartidos de AgentCore Gateway en la cuenta de servicios compartidos que apuntan a herramientas aprobadas para toda la organización. Cada herramienta expuesta a través de AgentCore Gateway tiene su propio ciclo de vida y proceso de CI/CD para implementarse en la fase previa a la producción.
Para registrar su herramienta en AgentCore Gateway, defina un manifiesto en su repositorio de herramientas que especifique la puerta de enlace a la que pertenece la herramienta (compartida o específica de la aplicación), el método de autenticación, el prefijo solicitado y los metadatos de cumplimiento. Al fusionarse, la canalización de CI/CD inyecta el punto final desde la configuración específica del entorno, valida el manifiesto, el prefijo de la herramienta y registra la herramienta como destino. Para ello, llama a CreateGatewayTarget y SynchronizeGatewayTargets, utilizando plantillas del repositorio de infraestructura. De esta manera, puede implementar nombres de herramientas coherentes y utilizar políticas de IAM para restringir el acceso directo de la puerta de enlace únicamente a la puerta de enlace. Los equipos de aplicaciones controlan qué se registra y el equipo de la plataforma dónde y cómo.
Memoria
Trate la configuración de la memoria como otros artefactos implementables que se versionan, prueban y promueven a través de su proceso de CI/CD. Controle las versiones de los recursos de memoria, las configuraciones TTL, las estrategias de extracción y las estructuras de espacios de nombres e impleméntelos a través de su canal de CI/CD para lograr un comportamiento idéntico en todos los entornos sin configuración manual ni deriva. Aplique pruebas automatizadas para validar la persistencia de la memoria, la calidad de la extracción LTM, el aislamiento del espacio de nombres y la recuperación entre sesiones antes de la promoción a producción.
Para ver cómo funcionan estos patrones operativos y de construcción a escala empresarial, vea cómo Allianz diseñó AIOps a escala empresarial con Amazon Bedrock AgentCore.
Tuberías confiables llevan a sus agentes a producción. La evaluación estructurada y multinivel detecta cualquier problema.
Pilar 3: Evaluación
Los agentes pueden fallar de maneras que no son inmediatamente obvias. Una selección de herramienta incorrecta, un contexto perdido o una respuesta alucinada pueden ser difíciles de detectar. La evaluación estructurada en múltiples niveles (herramienta, turno de conversación, resultado de la sesión y sistema) ayuda a evitar que estas fallas lleguen a producción. Los pasos del ciclo de vida de la evaluación son:
Construya el agente, busque, cree y actualice conjuntos de datos, generalmente capturando rastros de la ejecución del agente o utilizando entradas de expertos en el dominio. Seleccione evaluadores y métricas para realizar un seguimiento. Seleccione el modelo para juzgar los resultados de los agentes. Construya/configure la infraestructura para realizar estas evaluaciones. Registre los resultados, guárdelos en Amazon S3, sintetice información y ajuste Monitoree en producción, configure alarmas de Amazon CloudWatch para capturar desviaciones y revisiones humanas.
Si siguió la Parte 1: GenAIOps, su base de evaluación sigue siendo relevante, pero las aplicaciones agentes introducen requisitos adicionales: aún necesita evaluar los LLM, pero ahora también una cadena de decisiones, invocaciones de herramientas y recuperaciones de memoria que se combinan a lo largo de una conversación.
En los flujos de trabajo de Agentic, la evaluación se produce en cuatro niveles distintos por agente:
1. Nivel de herramienta (nivel de tramo)
Primero, evalúe la herramienta en sí. Para herramientas deterministas como las API, esto puede incluir pruebas unitarias para verificar el comportamiento esperado y métricas de rendimiento como latencia y tiempos de espera. Para herramientas respaldadas por LLM como RAG, evalúe las métricas de rendimiento del modelo utilizando human-in-the-loop o LLM-as-a-Judge. Las métricas de ejemplo incluyen corrección, utilidad, relevancia, nocividad y estilo/tono. Para los datos recuperados de bases de conocimiento, evalúe la calidad de la recuperación, la relevancia del fragmento y la actualización. Descubra cómo construir bases de datos sólidas para tener éxito. Para herramientas multimodales (audio a audio, generación de imágenes, creación de videos), evalúe las métricas de calidad específicas de la modalidad (fidelidad de imagen, claridad de audio, coherencia de video), consistencia intermodal (¿el contenido generado se alinea con las instrucciones de texto?), cumplimiento de políticas de contenido y seguridad, y latencia de generación.
En segundo lugar, evalúe el uso de la herramienta por parte del agente. Verifique que el agente razona y planifica correctamente, selecciona la herramienta adecuada para una tarea y extrae los parámetros relevantes con precisión de las consultas de los usuarios. Las métricas clave incluyen la precisión de la selección de herramientas, la precisión de la extracción de parámetros y la latencia de respuesta de la herramienta y las tasas de error.
2. Nivel de turno de conversación (nivel de seguimiento)
En este nivel, se evalúa un solo turno de conversación (un par de entrada y salida) para identificar respuestas problemáticas específicas y problemas de calidad. Algunos ejemplos de métricas son: Corrección (¿la información es objetivamente precisa), Utilidad (¿Qué tan útil es esta respuesta específica?) Fidelidad (¿La respuesta se basa en el contexto proporcionado?), Relevancia de la respuesta (¿Aborda la consulta del usuario?), Concisión, Coherencia, Seguimiento de instrucciones, Rechazo, Nocividad, Estereotipos. Hay métricas adicionales para evaluar en sistemas de múltiples agentes, algunos ejemplos son: precisión de la orquestación de agentes (¿puede el orquestador enrutar correctamente las solicitudes a los agentes apropiados y coordinar las transferencias entre ellos?), calidad del intercambio de información entre agentes, colaboración de agentes en tareas compartidas.
3. Nivel de resultados de la sesión
Este nivel examina si el agente logró el objetivo del usuario durante toda la conversación. Una respuesta individual correcta no garantiza un resultado exitoso. Las métricas clave incluyen la tasa de finalización de tareas, la precisión de los objetivos, la eficiencia de la conversación y la coherencia de la memoria.
4. Métricas a nivel del sistema
En este nivel, se evalúan los factores de preparación para la producción y de desempeño operativo. Algunas métricas de ejemplo son la latencia de un extremo a otro, el tiempo hasta el primer token, el rendimiento, las tasas de error de llamadas de herramientas, la detección de bucles y el costo por tarea completada. También puede tener métricas de éxito personalizadas que reflejen su caso de uso o requisitos comerciales. Por ejemplo, requisitos específicos del dominio, cumplimiento de normas reglamentarias o directrices de marca.
Evaluaciones bajo demanda y en línea
Además de los 4 niveles, la evaluación agente se ejecuta en dos modos que satisfacen diferentes necesidades:
La evaluación bajo demanda se ejecuta en intervalos, seguimientos o sesiones específicos durante el desarrollo y como puerta de calidad antes de cada lanzamiento. Proporciona entradas de referencia junto con la duración de las sesiones como estándar de oro para comparar los resultados. Las pruebas dirigidas incluyen depuración paso a paso, validación de componentes e integración de CI/CD. Las pruebas previas a la implementación incluyen validación de estabilidad, métricas de nivel de turno y monitoreo de componentes. Esta retroalimentación inmediata impulsa un ciclo iterativo para perfeccionar modelos, indicaciones, herramientas y lógica.
La evaluación en línea monitorea continuamente el tráfico de producción en vivo con tasas de muestreo configurables, desde muestreo de bajo volumen hasta cobertura total del tráfico. Muestra la calidad de la conversación, las métricas de nivel de turno y el monitoreo de componentes en sesiones de producción, durante las pruebas A/B y durante la implementación completa. Los resultados continuos se introducen en los paneles de Amazon CloudWatch para un seguimiento continuo.
La siguiente imagen muestra este flujo de trabajo:
En el desarrollo local y la cuenta de desarrollo, se ejecuta una evaluación bajo demanda para una iteración rápida. En la preproducción, la evaluación bajo demanda se convierte en una puerta de entrada. La compilación no pasa a producción hasta que se apruebe la evaluación. En producción, la evaluación en línea toma el control, muestreando continuamente el tráfico en vivo y avisándole cuando la calidad disminuye. Debe detectar problemas de calidad antes que sus usuarios. Cuando la evaluación detecta una caída en la calidad, los resultados se envían directamente a su cola de revisión humana o activan una reversión automática a través de su proceso de CI/CD.
Entorno Activador Cobertura Puerta Desarrollo Bajo demanda, manual y automatizado Herramientas, seguimientos, intervalos y sesiones. Evaluaciones de verdad sobre el terreno. Debe aprobarse antes de la preproducción Canalización de CI/CD de preproducción Regresión, integración, rendimiento y UAT Debe aprobarse antes de la promoción de producción Producción Tráfico en vivo continuo y muestreado Evaluación en línea Alertas automatizadas sobre degradación de la calidad
En AWS, con Amazon Bedrock Assessments, obtiene capacidades de LLM como juez y acceso a un equipo de trabajadores humanos para evaluar el rendimiento y la eficacia de los modelos y bases de conocimiento de Amazon Bedrock. Con AgentCore Assessments, tiene evaluaciones en línea y bajo demanda para sus agentes, mientras que Strands Assessment le brinda un marco para evaluar herramientas y Amazon Augmented AI (A2I) incorpora la revisión humana. Consulte Atlas de IA generativa: evaluación de casos de uso del marco agente para obtener información adicional sobre cómo evaluar agentes.
Para las métricas de rendimiento, puede utilizar Amazon CloudWatch para extraer registros y métricas y herramientas de desarrollo como pytest y JUnit para ejecutar pruebas unitarias en las API.
La evaluación le indica si su agente trabaja en el momento de la liberación; La observabilidad le dice si sigue funcionando y por qué se detiene.
Pilar 4: Observabilidad y seguimiento
La observabilidad es donde se completa el ciclo de AgentOps. La telemetría que produce retroalimenta las decisiones de gobernanza, informa el siguiente ciclo de evaluación y da forma a cómo se construye y se implementa en la siguiente iteración. Necesita visibilidad en cuatro capas distintas para sus agentes de producción:
Telemetría de agente y marco para auditar lo que su agente decidió e hizo, los pasos de razonamiento, las llamadas de modelo, las invocaciones de herramientas y las respuestas generadas por el marco de su agente, como el SDK de Strands. Telemetría de servicio para comprender lo que sucedió dentro de los servicios AgentCore de los que depende su agente, como lecturas y escrituras de memoria, operaciones de enrutamiento y autenticación de puerta de enlace, evaluaciones de identidades y políticas, y llamadas a herramientas integradas. Estas operaciones ocurren fuera del marco y son invisibles para la instrumentación a nivel de marco. Telemetría de infraestructura para monitorear el entorno que aloja su agente y sus herramientas, por ejemplo, métricas del contenedor de tiempo de ejecución y datos de ejecución de Lambda. Telemetría de aplicaciones para capturar las métricas que su negocio necesita que son operaciones distribuidas entre múltiples agentes y aplicaciones.
Estos son los tipos de datos que debería capturar:
Seguimiento de ejecución: cada paso, llamada de herramienta e interacción LLM
Registro estructurado: correlacione registros entre agentes y tiempos de ejecución Métricas y alertas: latencia, uso de tokens de entrada y salida, tiempo hasta el primer token (TTFT) y tasas de error, recuento de invocaciones de herramientas y recuento de invocaciones de modelos. Configure alarmas antes de que los usuarios se vean afectados. Memoria: qué recuerdan los agentes y por qué; detectar una configuración incorrecta antes de que revele inadvertidamente el contexto del usuario. IA responsable: toxicidad, sesgos y métricas similares, tasas de alucinaciones y fuga de PII. Seguimiento de costos: gasto de tokens por sesión, agente y tarea; sepa si su agente es económicamente sostenible a escala Métricas centradas en el ser humano: satisfacción, confianza y nuevo compromiso; Todas las demás métricas le indican el desempeño de su agente, esta le dice si importó.
Verifique que sus equipos de soporte, partes interesadas y expertos en el dominio tengan acceso a los paneles relevantes para poder actuar sobre estas métricas, por ejemplo, utilizando políticas basadas en identidad de IAM.
Hay tres capas para la observabilidad y el monitoreo: instrumentación (OpenTelemetry SDK, ya sea integrado directamente o mediante soporte nativo del marco), una capa de recopilación y procesamiento (AWS Distro para OpenTelemetry Collector o ADOT) y un backend de análisis (por ejemplo, Amazon CloudWatch). Los marcos de agentes como Strands SDK incluyen instrumentación OpenTelemetry (OTEL) incorporada. Para los agentes basados en Python, puede iniciar la instrumentación automática utilizando el comando opentelemetry-instrument. La telemetría se exporta a través del protocolo OpenTelemetry (OTLP) a un recopilador ADOT, que maneja el muestreo, el filtrado, el procesamiento por lotes y el enrutamiento. En desarrollo puedes exportar directamente a un backend, pero en producción recomendamos usar Collector como capa intermedia.
Cuando su arquitectura abarca varios agentes en diferentes marcos, la propagación del contexto de seguimiento W3C de OpenTelemetry pasa un ID de seguimiento compartido entre cada agente y servicio, lo que le brinda la ruta de ejecución completa en una sola vista. Para solicitudes que comparten una sesión lógica pero abarcan seguimientos separados, puede utilizar OpenTelemetry Baggage para propagar los ID de sesión a través de los límites del servicio. Para el backend, hemos visto dos enfoques: utilizar AgentCore Observability y sus paneles con tecnología de Amazon CloudWatch o herramientas de terceros a través de OpenTelemetry.
Enfoque 1: uso de la observabilidad de AgentCore en Amazon CloudWatch
Con Amazon CloudWatch, obtiene dos paneles para cargas de trabajo agentes.
El panel de invocación del modelo de CloudWatch cubre las métricas del modelo Bedrock, incluida la latencia, el recuento de tokens, las limitaciones y el recuento de errores, con filtros adicionales para patrones de tiempo, uso de herramientas y búsquedas de conocimiento.
El panel de Observabilidad de Bedrock AgentCore le brinda una vista integral de los flujos de trabajo de los agentes (seguimientos, costos, latencia, tokens y metadatos personalizados) con controles de acceso de IAM, redacción de PII y resúmenes de seguimiento para la resolución de problemas. Está impulsado por CloudWatch Transaction Search, que convierte intervalos a formato de convención semántica y los almacena como registros estructurados en el grupo de registros aws/spans, lo que hace que cada intervalo se pueda buscar y analizar. CloudWatch Application Signals correlaciona la telemetría de aplicaciones de IA generativa con métricas de infraestructura subyacente para una solución de problemas unificada de extremo a extremo.
AgentCore Runtime configura automáticamente los grupos de registros requeridos, los permisos de IAM y las variables de entorno OTEL y las aplicaciones solo necesitan agregar el SDK de OpenTelemetry como una dependencia. AgentCore también emite métricas de servicio a CloudWatch para sus recursos administrados, incluida la memoria, la puerta de enlace, las herramientas integradas, la identidad y la política. Por ejemplo, obtiene visibilidad en tiempo real de las operaciones de la memoria, incluidas invocaciones, latencia, errores del sistema, errores del usuario, limitaciones y números de registros para eventos y memoria. En implementaciones de múltiples cuentas, usted crea y administra paneles centralizados en la cuenta de monitoreo, reconstruyendo las vistas que existen de forma nativa en cuentas individuales.
Enfoque 2: Observabilidad de terceros a través de OpenTelemetry (OTEL)
Debido a que AgentCore Runtime exporta telemetría a través de protocolos estándar OpenTelemetry, se integra con soluciones de observabilidad de terceros, como LangFuse, que se especializan en telemetría centrada en agentes. Puede utilizar dichas herramientas de dos maneras:
Implementación de terceros autoadministrada: implemente la herramienta de observabilidad en una cuenta o VPC compartida de AWS, expuesta a través de un punto final TLS seguro. Los agentes en AgentCore Runtime en otras cuentas exportan seguimientos y métricas de OTEL directamente utilizando OTLP a través de HTTPS. Conecte cuentas a través de Transit Gateway y proteja el tráfico con rotación de credenciales, claves API y políticas de acceso a la red. Los controles de privacidad, retención y gobernanza de datos permanecen bajo su gestión directa.
SaaS de terceros: los agentes envían datos de OTEL a un punto final de nube administrado (por ejemplo, LangFuse Cloud, Arize Cloud). La autorización utiliza claves API del proveedor y el tráfico fluye a través de la Internet pública o a través de puntos finales de VPC, según la herramienta. Esto permite una rápida incorporación y escalamiento operativo, pero los datos de telemetría abandonan su entorno de AWS.
La telemetría de la observabilidad retroalimenta el diseño del agente, las decisiones de mejora operativa y los refinamientos de la evaluación, cerrando el ciclo de AgentOps.
Conclusión
Construir IA agente a nivel de producción es difícil. Los agentes toman decisiones autónomas, llaman a herramientas externas y colaboran de maneras que son difíciles de anticipar y de depurar. En esta publicación, hemos compartido las prácticas que hemos visto funcionar en producción en los cuatro pilares: gobernanza y seguridad, construcción y operaciones, evaluación y observabilidad.
Te animamos a que empieces a aplicar estas prácticas en tus proyectos y compartas tus experiencias. Comience implementando el Pilar 1 (Gobernanza y seguridad), aislamiento de múltiples cuentas, luego avance a CI/CD para agentes, agregue puertas de evaluación y observabilidad. Consulte la documentación de AgentCore para comenzar.