IA anormal: Amazon Bedrock AgentCore para seguridad de correo electrónico agente a escala

Los agentes de IA ahora se ejecutan en producción a una escala de miles de millones de operaciones por día, y ha surgido un patrón arquitectónico recurrente: los agentes necesitan un bloc de notas informático. No solo para tareas de codificación, sino también para agregación de datos, análisis, verificación y cualquier flujo de trabajo donde el razonamiento semántico por sí solo no sea suficiente.

Annormal AI, un servicio de seguridad conductual que protege a más del 25 por ciento de las empresas Fortune 500, ha implementado Amazon Bedrock AgentCore Code Interpreter, una capacidad de Amazon Bedrock AgentCore. Annormal AI lo utiliza para los agentes que respaldan la detección de amenazas de correo electrónico en línea en tiempo real. Estos sistemas se ejecutan hoy en producción, procesan miles de millones de mensajes y ejecutan código impulsado por agentes a esa misma escala para detectar y bloquear amenazas en línea, antes de que lleguen a la bandeja de entrada.

Este trabajo es parte de cómo Abnormal AI crea software. Hoy en día, el 80 por ciento de sus cambios de código se crean utilizando un agente de alguna manera, y el 40 por ciento se construye de un extremo a otro mediante un agente en segundo plano (totalmente creado por IA, no asistido por IA). Su uso de AgentCore Code Interpreter para la detección de amenazas refleja el mismo enfoque nativo de IA aplicado a su tiempo de ejecución de producción.

En esta publicación, compartimos cómo Abnormal AI diseñó estos sistemas, las decisiones de diseño detrás de su enfoque de espacio aislado y lecciones prácticas para los constructores que implementan Code Interpreter a escala.

¿Qué es el intérprete de código AgentCore de Amazon Bedrock?

Amazon Bedrock AgentCore Code Interpreter proporciona un tiempo de ejecución sin servidor totalmente administrado para que los agentes ejecuten código de forma dinámica. Las características clave incluyen:

Sesiones efímeras de MicroVM: tiempo de vida configurable desde 15 minutos (predeterminado) hasta 8 horas para tareas de larga duración. Seguridad: las sesiones se ejecutan en entornos limitados seguros con separación total a nivel del sistema operativo host, diseñados para ayudar a evitar la divulgación involuntaria entre sesiones. Redes flexibles: configurable para modo sandbox de nube privada virtual (VPC) o acceso público a Internet. Manejo de archivos: hasta 100 MB a través de la API directamente o conéctese a Amazon Simple Storage Service (Amazon S3) para conjuntos de datos más grandes. Tiempos de ejecución precargados: entornos Python y Node.js con bibliotecas comunes de visualización, estadísticas y procesamiento de datos. Observabilidad integrada: registros enviados a Amazon CloudWatch y AWS CloudTrail para su monitoreo.

Fundamentalmente, Code Interpreter se expone como una API. Esto significa que no dicta el flujo de trabajo del agente. En cambio, proporciona un cuadro donde el agente puede ejecutar comandos, cargar archivos y recuperar resultados. Para equipos con infraestructura de agentes existente, este diseño plug-and-play simplifica la integración.

Figura 1: Arquitectura de Amazon Bedrock AgentCore Code Interpreter, donde el agente invoca la API Code Interpreter para aprovisionar una sesión efímera de espacio aislado de MicroVM para la ejecución de código, entrada y salida de archivos y recuperación de resultados.

Por qué los agentes necesitan un bloc de notas informático

Los modelos de lenguajes grandes (LLM) destacan en el razonamiento y la coherencia semántica, pero muchas operaciones del mundo real no se corresponden con el razonamiento semántico:

Matemáticas básicas y conteo: “¿Cuántos correos electrónicos de phishing detectamos en la última hora?” requiere computación, no generación de lenguaje. Procesamiento y visualización de datos: transformar datos sin procesar en gráficos, archivos PDF o informes estructurados. Verificación de código: ejecutar pruebas unitarias, linting y pruebas de integración para validar los resultados generados por el agente.

Al combinar un modelo de lenguaje grande con Code Interpreter, se mejoran las capacidades del agente más allá de lo que el razonamiento por sí solo puede lograr.

“Prácticamente cualquier agente, ya sea que escriba código o no, necesita un entorno limitado de interpretación de código que le permita analizar datos y obtener respuestas”.

— Shrivu Shankar, vicepresidente de estrategia de IA, IA anormal

Arquitectura de IA anormal: detección de tres niveles a escala de mil millones de mensajes

La IA anormal procesa miles de millones de mensajes de correo electrónico a través de una arquitectura de detección de tres niveles, como se muestra en la Figura 2.

Canal de detección de correo electrónico de tres niveles que pasa de heurísticas de nivel 1 a modelos de aprendizaje automático de nivel 2 y agentes en línea de nivel 3 con Code Interpreter

Figura 2: Canal de detección de correo electrónico de tres niveles de Annormal AI, con el Nivel 1 (heurística, miles de millones/día), el Nivel 2 (modelos de aprendizaje automático, millones/día) y el Nivel 3 (agentes en línea con Code Interpreter, decenas de miles/día), donde cada nivel maneja casos progresivamente más difíciles en los que el nivel anterior no estaba seguro

Nivel 1: clasificación de peso ligero de gran volumen (miles de millones/día)

Los modelos pequeños, las reglas heurísticas y los clasificadores ligeros (regresiones logísticas) manejan el mayor volumen de tráfico. A esta escala, ejecutar modelos más grandes tiene un costo prohibitivo y además es innecesario. La mayoría de los mensajes se pueden clasificar sin un análisis profundo.

Nivel 2: modelos medianos para casos inciertos (millones/día)

Los mensajes sobre los que el Nivel 1 no está seguro fluyen hacia modelos de aprendizaje profundo y aprendizaje automático (ML) que realizan más análisis de señales de comportamiento.

Nivel 3: agentes en línea con Code Interpreter (decenas de miles/día)

Los casos más difíciles, que normalmente requerirían la evaluación de un analista humano, son procesados ​​por agentes en línea. Estos agentes reciben los datos de inteligencia sobre amenazas y utilizan un entorno de pruebas para analizarlos, escribiendo scripts de forma dinámica. Luego evalúan cómo encaja en el modelo de comportamiento general y toman una determinación. Las clasificaciones erróneas son manejadas por un sistema separado que aprende y mejora el sistema. Una variedad de sistemas de monitoreo verifican el sistema en vivo.

El agente analista: inteligencia por lotes

Más allá del proceso de clasificación en tiempo real que se muestra en la Figura 2, Abnormal implementa un agente analista que opera en modo por lotes (Figura 3):

Ingiere clasificaciones erróneas y señales de sintonización de su canal de detección. Identifica patrones y tendencias en grandes conjuntos de mensajes. Escribe de forma autónoma borradores de heurísticas candidatas para el Nivel 1, operando con las características y señales del canal de detección de IA anormal. Modelos mejorados para el Nivel 2. Se ejecuta en una escala de aproximadamente 100 trabajos por lotes por semana.

El circuito de retroalimentación del agente analista alimenta heurísticas y modelos mejorados desde el análisis por lotes al Nivel 1 y al Nivel 2.

Figura 3: El ciclo de retroalimentación del agente analista, donde el agente por lotes ingiere clasificaciones erróneas del proceso en tiempo real, analiza patrones mediante sesiones de Code Interpreter y alimenta heurísticas y modelos mejorados al Nivel 1 y al Nivel 2.

Estos trabajos por lotes pueden ejecutarse durante más de 30 minutos con sesiones de Code Interpreter mantenidas en todo momento. También pueden abarcar operaciones de un día en las que el agente utiliza Code Interpreter de forma intermitente. Por ejemplo, ejecuta una sesión, entrena un modelo externamente y luego vuelve a invocar Code Interpreter para procesar el resultado.

Seguridad: diseño de zona de pruebas de confianza cero

Anómalo eligió la configuración de espacio aislado (sin salida) para Code Interpreter basándose en dos consideraciones:

Reproducibilidad: debido a que el sandbox no tiene acceso a la red externa, nada fuera del control de Annormal AI puede influir en el comportamiento del agente durante esa sesión. El entorno está diseñado para ser completamente determinista. Prevención de filtración de datos: los datos de inteligencia sobre amenazas ingresan al entorno sandbox para su análisis. Incluso si el agente se vuelve malicioso mediante una inyección rápida o un comportamiento estocástico, está diseñado para evitar la filtración de esos datos a Internet.

Prácticas de seguridad adicionales:

Ingestión de datos controlada: intencional sobre qué tipos de datos ingresan a Code Interpreter y qué acciones de escritura están permitidas. Alineación del subprocesador: Code Interpreter opera bajo la relación de subprocesador existente de AWS y reduce los gastos generales de cumplimiento. Capas de aislamiento de red: el aislamiento de espacio aislado sobre su arnés aislado de red existente proporciona una defensa en profundidad.

Lecciones aprendidas y mejores prácticas

Varias prácticas surgieron al ejecutar Code Interpreter en producción en Abnormal AI.

1. Dale al agente lo que quiere

Los agentes se desempeñan mejor con un arnés general liviano en lugar de flujos de trabajo rígidos paso a paso. Proporcione principios de alto nivel para resolver un problema y permita que el agente use su inteligencia para determinar el enfoque.

2. Cada agente necesita un bloc de notas

Code Interpreter no es sólo para agentes de codificación. Los agentes de seguridad que analizan el correo electrónico se benefician de los blocs de notas informáticos para la agregación de datos, el análisis de patrones y la verificación.

3. Utilice verificadores programáticos como barreras de seguridad

Los agentes ofrecen resultados de mayor calidad cuando cuentan con herramientas de verificación programática. Las pruebas unitarias, las pruebas de integración y el linting permiten que el agente realice autopruebas dentro del entorno sandbox antes de entregar los resultados finales.

4. Utilice sistemas de archivos como puntos de recuperación para tareas de larga duración

Para operaciones que excedan el tiempo de sesión de Code Interpreter (por ejemplo, entrenamiento de modelos), utilice el sistema de archivos como punto de control. Ejecute Code Interpreter para realizar cálculos, persista el estado en archivos, realice operaciones de ejecución prolongada externamente y luego vuelva a invocar Code Interpreter para procesar los resultados. El agente analista (Figura 3) utiliza este patrón para operaciones de entrenamiento de modelos de un día de duración.

Conclusión

La implementación de Abnormal AI demuestra una idea clave para los sistemas de agentes de producción: Code Interpreter no es simplemente una herramienta de codificación. Es una infraestructura fundamental que los agentes utilizan para razonar computacionalmente. Al combinar el entorno limitado seguro y administrado de AgentCore Code Interpreter con su propio arnés de agente liviano, Abnormal logra:

Postura de seguridad de confianza cero a través del aislamiento de espacio aislado que ayuda a prevenir la filtración de datos. Escala de miles de millones de mensajes reservando el cálculo del agente para los casos más difíciles (Figura 2).

Ya sea que esté creando agentes de seguridad o un sistema donde los agentes necesitan procesar datos y verificar sus propios resultados, el patrón es claro. Ofrezca a sus agentes un bloc de notas y confíe en sus evaluaciones más de lo que confía en sus afirmaciones.

Próximos pasos

Comience con el intérprete de código AgentCore de Amazon Bedrock. Explore las capacidades de AgentCore y otras herramientas (Puerta de enlace, Memoria, Tiempo de ejecución, Identidad). Obtenga más información sobre la IA anormal en anormalsecurity.com.

La IA anormal es un cliente de AWS. Los puntos de vista y opiniones expresados ​​en esta publicación son los del cliente y no reflejan necesariamente los puntos de vista de Amazon Web Services.

Sobre los autores

Aswin Vasudevan

Aswin Vasudevan

Aswin es arquitecto senior de soluciones de seguridad, ISV en AWS. Es un gran admirador de la IA generativa y la arquitectura sin servidor y disfruta colaborar y trabajar con los clientes para crear soluciones que impulsen el valor empresarial.

Felipe López

Felipe es arquitecto principal de soluciones especializado en IA/ML en AWS. Antes de unirse a AWS, Felipe trabajó con GE Digital y SLB, donde se centró en productos de modelado y optimización para aplicaciones industriales.

Shrivu Shankar

Shrivu Shankar

Shrivu es vicepresidente de estrategia de IA en Abnormal AI, donde lidera la transformación de la IA y promueve aplicaciones prácticas de sistemas agentes en ciberseguridad y desarrollo de software. Ingeniero en aprendizaje automático, se especializa en la creación de flujos de trabajo nativos de IA y sistemas multiagente.