Agentes de IA de nivel de producción para el cumplimiento financiero: lecciones de Stripe

Esta publicación está coescrita por Christopher Phillippi y Chrissie Cui de Stripe.

Stripe procesa 1,4 billones de dólares en volumen de pagos anuales en 50 países, lo que requiere que los equipos de cumplimiento revisen miles de transacciones diariamente. Esta publicación explora cómo Stripe creó un sistema de agentes de IA de nivel de producción en AWS utilizando Amazon Bedrock que redujo el tiempo de procesamiento de revisiones en un 26 por ciento y, al mismo tiempo, mantuvo la supervisión humana. La publicación cubre la arquitectura técnica, las decisiones de infraestructura y las lecciones aprendidas al implementar IA agente que logró calificaciones de utilidad de más del 96 por ciento, con expertos humanos firmemente en control de las decisiones finales.

En esta publicación, aprenderá cómo Stripe creó un sistema de agentes de IA de nivel de producción para el cumplimiento financiero. Cubrimos la arquitectura técnica del marco del agente ReAct de Stripe y las decisiones de infraestructura detrás de un servicio de agente dedicado. También analizamos el papel de la supervisión humana en el mantenimiento de la responsabilidad y lecciones clave sobre la descomposición de tareas, patrones de orquestación y optimización de costos mediante el almacenamiento en caché rápido. Al final, comprenderá cómo diseñar sistemas agentes que escalen las operaciones de cumplimiento sin comprometer la calidad o la auditabilidad.

El desafío de escala y cumplimiento de Stripe

La misión fundamental de Stripe es hacer crecer el producto interno bruto (PIB) de Internet. Esa búsqueda requiere una infraestructura financiera programable diseñada para respaldar transacciones fluidas y una gestión operativa para empresas de todas las escalas. A principios de 2026, Stripe ha crecido más allá de sus orígenes como API de pago centrada en el desarrollador para convertirse en un pilar sistémico de la economía global. La compañía respalda a millones de empresas en 50 países, desde empresas emergentes en etapa inicial hasta el 62 por ciento de las Fortune 500, y procesa aproximadamente 1,4 billones de dólares en volumen de pagos anuales. Esta escala representa aproximadamente el 1,3 por ciento del PIB mundial total, lo que posiciona a Stripe en el nexo crítico entre la innovación tecnológica y los marcos regulatorios sólidos.

El problema del escalamiento del cumplimiento

A medida que la presencia global de Stripe se expandió a 50 países, la organización enfrentó un desafío crítico: cómo escalar las operaciones de cumplimiento sin aumentos proporcionales de personal y al mismo tiempo mantener los estándares de calidad regulatorios. Todos los días, los equipos de cumplimiento realizan revisiones detalladas para identificar y mitigar los riesgos de delitos financieros. Sin embargo, los analistas expertos dedicaban hasta el 80% de su tiempo a navegar por sistemas fragmentados para recopilar documentación en lugar de realizar evaluaciones de riesgos de alto valor. La solución de Stripe integra agentes de IA con orquestación automatizada, transformando el cumplimiento de un proceso que requiere muchos recursos a un motor escalable. Este enfoque aborda la carga de cumplimiento global de $206 mil millones al ayudar a las organizaciones a identificar el 95 % de los ataques de prueba de tarjetas en tiempo real y reducir la fricción innecesaria con los clientes en un 20 %. El enfoque también mantiene la auditabilidad y precisión requeridas por los reguladores.

¿Por qué IA agente para el cumplimiento?

Las limitaciones de la automatización tradicional para el trabajo de cumplimiento complejo y basado en juicios significan que se necesitan agentes de IA para manejar investigaciones asistidas con escala, calidad constante y auditabilidad total, manteniendo al mismo tiempo el control de los humanos.

Tres pilares

Supervisión y responsabilidad: validación centrada en el ser humano con flujos de trabajo de aprobación configurables y puntos de control de decisiones de múltiples capas. Los humanos permanecen en el asiento del conductor, apoyados por agentes. Transparencia: seguimiento de auditoría completo con documentación inmutable de cada acción, decisión y justificación. Eficiencia: la investigación previa y el análisis dinámico permiten revisiones más profundas a un ritmo más rápido.

Arquitectura técnica

La implementación técnica del sistema de cumplimiento agente de Stripe consta de tres componentes clave: descomposición y orquestación de tareas, el marco del agente ReAct y servicios de infraestructura de soporte. Cada componente desempeña un papel fundamental para lograr una automatización del cumplimiento escalable y auditable.

Descomposición de tareas y orquestación de revisión.

Asignar a un solo agente para que se encargara de esta revisión larga y complicada de una sola vez no habría funcionado. Un agente único y sin restricciones se habría centrado demasiado en las cosas equivocadas y no lo suficiente en lo que realmente se necesitaba. En cambio, Stripe hizo que la solución fuera manejable al dividir la complicada revisión en subtareas componibles y pequeñas. Cada subtarea podría potencialmente depender de los resultados de otras subtareas como un gráfico acíclico dirigido (DAG). Estos rieles ayudan a verificar que cada proceso de agencia solo se ejecute en preguntas examinadas donde la calidad se ha medido mediante pruebas de calidad. También ayudan a confirmar que la investigación cubre las bases requeridas y brindan al agente suficiente contexto y enfoque para brindar resultados de calidad.

A pesar de las rigurosas pruebas de calidad de las respuestas de los agentes en cada subtarea, la implementación de Stripe no depende directamente de la respuesta de un agente. En cambio, las respuestas se proporcionan como información complementaria al revisor humano, quien en última instancia debe responder a cada subtarea de la revisión. Esto resuelve la supervisión y la rendición de cuentas y al mismo tiempo captura los beneficios de eficiencia. El flujo de revisión de alto nivel se muestra en el siguiente diagrama.

Los revisores interactúan con las herramientas de revisión, que conocen la pregunta actual y qué preguntas posteriores requieren esa respuesta como contexto. La herramienta funciona como orquestador, canalizando respuestas revisadas por humanos como contexto para más preguntas.

Implementación del marco del agente ReAct

Para obtener investigaciones para cada subpregunta, Stripe creó un agente de cumplimiento utilizando una forma del marco del agente ReAct (razonamiento y acción). Más allá de utilizar un modelo de lenguaje grande (LLM), un tipo de modelo básico (FM) en Amazon Bedrock para el razonamiento, el aspecto agente recopila dinámicamente señales relevantes a través de llamadas a herramientas. Stripe eligió este marco de agente para resolver el problema de un número casi infinito de señales que pueden o no ser relevantes para un tema determinado. Los agentes determinan qué señales son relevantes y proponen seguimientos hasta que tengan la confianza suficiente para dar una respuesta final. La lógica del agente de alto nivel se muestra en el siguiente diagrama.

Diagrama que ilustra el ciclo del marco del agente ReAct que muestra el proceso iterativo de los pasos de Pensamiento, Acción (llamadas a herramientas) y Observación hasta llegar a una respuesta final.

Para recorrer este flujo, imagine que le hacen la pregunta: "¿cuál es la respuesta a 10 dividido por el número π?"

Si fuera un agente de ReAct, lo primero que pensaría sería considerar si ya tiene la respuesta. No es así, por lo que propondría la acción de sacar una calculadora e ingresar 10/π. La calculadora entonces devolvería una observación. Su siguiente pensamiento sería determinar si tiene una respuesta y proporcionaría ese cálculo como respuesta final. Puede imaginarse algo más difícil, como “producir un análisis que pronostique los ingresos de la empresa el próximo año”, requiriendo muchos ciclos de iteraciones de consulta (Herramienta) e interpretación (Pensamiento) de bases de datos.

En el ciclo ReAct, cada vez que se solicita una herramienta en el bloque Pensamiento, el marco del agente detiene la ejecución de LLM y, en su lugar, ejecuta esa herramienta mediante programación. Luego fuerza esa salida como una observación al agente antes de permitirle continuar. Este patrón de inyección implementa un mecanismo de control de circuito cerrado que:

Fundamenta el razonamiento del agente en datos reales: al exigir que cada resultado de la herramienta debe procesarse como una observación, esto evita que el agente alucine o fabrique resultados de la herramienta. Mantiene la coherencia del contexto: obliga al agente a reconocer y razonar explícitamente sobre cada pieza de información recuperada antes de continuar. Previene la deriva del razonamiento: el paso de observación actúa como un punto de control, lo que ayuda a verificar que el proceso de pensamiento del agente permanece anclado a los resultados de las herramientas factuales en lugar del razonamiento especulativo. Admite la auditabilidad: crea un seguimiento explícito de la invocación de la herramienta → observación → razonamiento que se puede registrar para la revisión del cumplimiento.

Esto es análogo a un sistema de control de retroalimentación en ingeniería. El agente no puede pasar a la siguiente acción sin procesar primero la retroalimentación (observación) de su acción anterior, evitando un comportamiento de bucle abierto que podría provocar alucinaciones o razonamiento fuera de lugar.

Un desafío con este enfoque es que cuando una tarea es tan complicada que necesita muchos turnos y observaciones, la indicación puede volverse muy larga en los turnos posteriores, particularmente con observaciones detalladas. La descomposición de subtareas limita el alcance de cada pregunta para mantener menor el número de turnos. El almacenamiento en caché rápido también ayuda con el costo de los tokens de entrada, que es el principal factor de costo aquí. Con el almacenamiento en caché rápido, solo paga por las nuevas observaciones y pensamientos que se agregan a los mensajes anteriores en cada turno. Amazon Bedrock proporciona esta capacidad.

Arquitectura e infraestructura de revisión agente completa

Stripe dependió de una cantidad significativa de infraestructura para respaldar la ejecución agente real. El siguiente diagrama muestra la arquitectura completa.

Diagrama de arquitectura que muestra el sistema de revisión de agente completo, incluida la interfaz de revisión, el orquestador, el servicio de agente, el servicio LLM Proxy y las conexiones a señales internas a través de la herramienta de agente.

La arquitectura completa consta de la interfaz de revisión y el orquestador tratados anteriormente y un servicio de agente que aloja la lógica del agente y facilita la ejecución. El servicio de agente está respaldado por el servicio LLM Proxy de Stripe y está conectado a señales internas a través de las herramientas de agente disponibles.

Creación de un servicio de agente dedicado

Antes de este proyecto, el servicio de agente de Stripe no existía y este proyecto resultó en que Stripe lo solicitara. Inicialmente, Stripe intentó integrar un agente en un motor de inferencia de ML tradicional. Este enfoque fue rápidamente rechazado por las siguientes razones:

Perfiles informáticos: el aprendizaje automático tradicional está vinculado a la informática y requiere hardware costoso, como GPU, CPU rápidas de subprocesos múltiples o grandes asignaciones de memoria. Por el contrario, las aplicaciones agentes están en su mayoría vinculadas a la red, esperando que finalicen los modelos básicos o que se ejecuten las llamadas de herramientas. Latencia: haciendo referencia al flujo de ReAct descrito anteriormente, un agente puede tardar una cantidad de tiempo indeterminada en finalizar, dependiendo de cuántas rondas de llamadas a herramientas necesite. Una consulta larga de un agente o una llamada a una herramienta de base de datos podría hacer que un subproceso permanezca inactivo durante minutos, en comparación con un modelo XGBoost que finalizaría en milisegundos. API diferente: a diferencia del aprendizaje automático tradicional que tiende a generar tipos básicos (flotantes, booleanos y otros), los agentes necesitan más flexibilidad en su esquema para anotar sus resultados. Algunos agentes necesitan mantener estados de conversación con estado.

Como resultado, Stripe creó su propio servicio de agente, que inicialmente se asemejaba a un punto final de inferencia sincrónico y sin estado. Hoy en día también maneja agentes conversacionales con estado y de múltiples turnos. Ha pasado de unos pocos agentes en el lanzamiento a más de 100 agentes en menos de un año.

Arquitectura de proxy LLM

El agente ReAct de Stripe no llama directamente a Amazon Bedrock. En cambio, Stripe utiliza un microservicio LLM Proxy como método estándar para el acceso a LLM. El siguiente diagrama muestra la arquitectura de LLM Proxy.

Diagrama que muestra la arquitectura de microservicio LLM Proxy que proporciona un único punto final API para acceder a múltiples modelos básicos con características como protección de vecinos ruidosos, respaldo de modelos y monitoreo.

Stripe utiliza un servicio LLM Proxy por los siguientes motivos:

Vecinos ruidosos: Stripe tiene muchos equipos que utilizan LLM para diversas aplicaciones. El LLM Proxy proporciona protección contra otros equipos que acaparan el ancho de banda de LLM para un modelo en particular, evitando la contención de recursos. Una API, muchos modelos: el punto final único simplifica la especificación de capacidades como el almacenamiento en caché rápido o la llamada de herramientas en los modelos básicos de Amazon y empresas líderes en inteligencia artificial. Cambiar modelos solo requiere cambiar el tipo de modelo como argumento, en lugar de que cada caso de uso administre muchos clientes diferentes. Modelos alternativos: esto proporciona la capacidad de especificar automáticamente modelos predeterminados en caso de limitaciones de recursos o falla total. Monitoreo: al requerir autenticación, el servicio puede rastrear el uso del modelo para ayudar a pronosticar la demanda futura de recursos y confirmar que se están utilizando los modelos apropiados según la privacidad de la aplicación.

Cómo funcionan juntos los componentes arquitectónicos

Los revisores humanos dirigen la revisión, utilizando respuestas de agentes como investigación precargada. A medida que responden, esas respuestas se pueden utilizar en las indicaciones para preguntas más profundas durante la misma revisión, orquestando las preguntas de revisión como un gráfico acíclico dirigido (DAG).

Para una pregunta determinada, el agente puede llamar a herramientas para acceder dinámicamente a datos o servicios internos según sea necesario. Este enfoque se utiliza porque las posibles señales relevantes que podrían examinarse suelen ser mucho mayores que las que se pueden incluir en una indicación. El aspecto de llamada de herramientas del agente significa que el registro de pensamientos incluye solo los datos relevantes para responder a la pregunta actual, sin información adicional irrelevante que induzca a concentrarse.

El agente en sí está impulsado por modelos básicos de Amazon y empresas líderes en inteligencia artificial, que son responsables de pensar y determinar qué herramientas se necesitan. La aplicación del agente accede al LLM a través del Cliente LLM, que abstrae características como el almacenamiento en caché de avisos y los respaldos de modelos.

Beneficios de la integración de Amazon Bedrock

Stripe utiliza Amazon Bedrock dentro de su LLM Proxy. Amazon Bedrock ofrece los siguientes beneficios adicionales:

Privacidad y seguridad estandarizadas: como procesador de pagos, Stripe debe tener mucho cuidado con la privacidad y la seguridad. Amazon Bedrock ayuda a verificar que los modelos básicos de Amazon y de las principales empresas de IA se ajusten a las limitaciones de seguridad y privacidad existentes, sin necesidad de realizar revisiones adicionales para cada modelo. Rica en funciones: como se describió anteriormente, Amazon Bedrock permite el almacenamiento en caché rápido en los modelos compatibles. Además, Amazon Bedrock permite realizar ajustes y ofrecer modelos personalizados, en los que Stripe espera centrarse el próximo año. Una API, muchos modelos: la integración es sencilla porque los modelos se encuentran dentro de la misma API. Para cambiar de modelo es necesario utilizar un nombre de modelo diferente. Amazon Bedrock también admite muchos modelos básicos diferentes de Amazon y empresas líderes en inteligencia artificial, lo que proporciona un rendimiento estándar de la industria para Stripe.

Implementación de pistas de auditoría para el cumplimiento normativo

Aunque en última instancia Stripe utiliza revisores humanos para emitir juicios y tomar decisiones, el sistema aún debe verificar que resiste el escrutinio regulatorio. Como resultado, Stripe implementó el registro para que todo el registro del agente sea recuperable históricamente para cada ejecución. Cada acción, decisión y justificación de un agente está documentada.

Resultados e impacto: revisiones un 26 por ciento más rápidas con más del 96 por ciento de utilidad

Stripe logró una reducción del 26 por ciento en el tiempo medio de procesamiento de revisiones a través de la automatización de agentes, con calificaciones de utilidad de más del 96 por ciento mantenidas por los revisores y revisores humanos en control de las decisiones. Esto se logró al mismo tiempo que se proporcionaban pistas de auditoría completas que cumplían con los estándares de examen.

A medida que Stripe siga creciendo, la organización podrá mantenerse al día con la demanda proporcional de gestión de riesgos. Los revisores humanos pueden centrar su tiempo en problemas más difíciles o en nuevas oportunidades de investigación, lo que conducirá a un programa de cumplimiento mejorado.

Lecciones clave aprendidas de la implementación de producción

A través del proceso de construcción e implementación de este sistema de IA agente de producción, Stripe destiló varios conocimientos que dieron forma al éxito del proyecto y pueden informar implementaciones similares.

Tareas breves: mantenga las tareas del agente lo suficientemente pequeñas como para la memoria de trabajo. Pruebe la calidad de forma incremental en lugar de sumergirse directamente en la automatización total.

Orquestación: la arquitectura de flujo de trabajo asíncrono con soporte DAG es esencial para interacciones complejas de agentes y al mismo tiempo mantiene la auditabilidad y la supervisión humana a escala.

Infraestructura: la arquitectura de microservicios dedicada es importante porque los agentes tienen perfiles de recursos fundamentalmente diferentes a los modelos de ML tradicionales. Los sistemas de inferencia tradicionales están vinculados a la computación y optimizados para respuestas de milisegundos en costosos hardware GPU. Los agentes están vinculados a la red y pasan minutos esperando llamadas de LLM y ejecuciones de herramientas con patrones de latencia impredecibles. Un servicio de agente dedicado maneja estas interacciones con estado de larga duración a través de patrones de ejecución asíncronos. Esto permite que los subprocesos administren de manera eficiente múltiples sesiones de agentes simultáneas sin bloquear llamadas externas. El almacenamiento en caché de tokens reduce los costos en un 60 % al reutilizar prefijos de mensajes comunes en los turnos de los agentes en lugar de reprocesar todo el historial de conversaciones en cada paso. La instrumentación de costos rastrea el uso de tokens por invocación de agente, lo que ayuda a los equipos a pronosticar el gasto a medida que aumentan las cargas de trabajo e identificar oportunidades de optimización antes de que afecten los presupuestos. Este enfoque de infraestructura primero transformó a los agentes de un prototipo experimental a un servicio de producción que brinda soporte a más de 100 agentes en Stripe.

Mantenga a los humanos en control: los agentes ayudan, pero los revisores expertos mantienen la autoridad de decisión final. Restrinja los agentes con rieles al contexto vinculado.

¿Qué sigue?

Inicialmente, Stripe se centró en preguntas que pueden responderse incluso antes de que comience la revisión. Es probable que las preguntas restantes requieran un contexto previo conocido y validado durante la revisión. Esto conducirá a investigaciones más complejas de varios pasos que orquesten respuestas en tiempo real como contexto durante la revisión, lo que respaldará mejoras de eficiencia más profundas. La actual reducción del 26 por ciento representa un progreso temprano.

Debido a que Stripe no está dispuesto a aceptar un aumento en la tolerancia al riesgo mediante el uso de esta tecnología, el equipo prueba el componente de investigación agente según los estándares de calidad humana. El equipo valida con humanos reales antes de permitir que el componente informe a los revisores en producción. El equipo también está explorando formas de utilizar los LLM para juzgar y eliminar rápidamente enfoques deficientes.

Amazon Bedrock ofrece capacidades de personalización que Stripe está explorando para mejorar aún más su sistema de cumplimiento. Actualmente, Stripe utiliza Retrieval Augmented Generation (RAG) para la inyección dinámica de conocimiento a través de llamadas a herramientas, lo que brinda a sus agentes acceso a datos de cumplimiento en tiempo real. De cara al futuro, Stripe está considerando utilizar las capacidades de ajuste de Amazon Bedrock para adaptar el comportamiento del modelo específicamente para tareas de cumplimiento financiero. Esto ayudaría a asegurar la calidad del modelo y reduciría los gastos generales de reevaluación a medida que los modelos evolucionan. Además, Amazon Bedrock ofrece opciones continuas de capacitación previa para incorporar conocimientos de dominios específicos, lo que podría ayudar a incorporar una experiencia de cumplimiento más especializada en el razonamiento de los agentes. La ventana de control de versiones del modelo y aviso de obsolescencia de 6 meses en Amazon Bedrock ayuda a planificar estratégicamente estos esfuerzos de personalización, permitiendo actualizaciones del modelo solo cuando mejoran significativamente las capacidades de investigación. Estas técnicas complementarias trabajan juntas para equilibrar el rendimiento, la estabilidad y la adaptabilidad a medida que escalan las operaciones de cumplimiento.

Conclusión

Stripe ha demostrado que los agentes pueden acelerar los procesos de revisión manual, logrando una reducción del 26 por ciento en el tiempo de manejo de la revisión y al mismo tiempo manteniendo índices de utilidad de más del 96 por ciento, incluso cuando los humanos mantienen la autoridad para tomar decisiones en lugar de una automatización total. En lugar de depender únicamente del poder de los agentes, Stripe logró esto construyendo rieles para limitar a los agentes a áreas de revisión pequeñas donde pueden tener éxito. Para lograr esto, Stripe necesitaba una nueva infraestructura de servicio de agentes, inspirada pero distinta de los sistemas de inferencia de aprendizaje automático que han existido históricamente.

Esto fue posible con Amazon Bedrock, que proporcionó a Stripe las protecciones de privacidad y la selección de modelos que respaldaron este salto en la eficiencia de las revisiones, y se espera que estas capacidades se extiendan a muchos otros dominios.

Para obtener más información sobre cómo crear sistemas agentes similares en Amazon Bedrock, consulte la Guía del usuario de Amazon Bedrock y la documentación de almacenamiento en caché de solicitudes de Amazon Bedrock. Para comenzar, visite la consola de Amazon Bedrock.

Sobre los autores

Christopher Phillippi

Christopher Phillippi

Christopher es científico de datos del personal en Stripe y se especializa en sistemas de IA/ML para revisiones de riesgos y cumplimiento, iniciando el diseño técnico de la automatización de revisiones de cumplimiento de extremo a extremo, desde los sistemas de ML que activan las revisiones hasta los agentes de llamada de herramientas que hacen que los revisores humanos sean más efectivos y al mismo tiempo preservan su autoridad para tomar decisiones. Con 12 años de experiencia en la creación de sistemas de aprendizaje automático de producción en servicios financieros, juegos y plataformas sociales, anteriormente se desempeñó como ingeniero de aprendizaje automático en Meta, diseñando sistemas de aprendizaje de gráficos, creó sistemas de recomendación en Electronic Arts y comenzó su carrera en la mesa de operaciones cuantitativas del Royal Bank of Canada como Quant.

Chrissie Cui

Chrissie Cui

Chrissie es una distinguida gerente de gerentes y líder de plataforma en Stripe con más de 15 años de experiencia diseñando, escalando y garantizando la confiabilidad de la infraestructura de datos e IA/ML de misión crítica. En Stripe, lidera AI Platform y es propietaria de la pila de agentes de IA de extremo a extremo, desde Kai, el agente de productividad interna utilizado por todos los empleados de Stripe a diario, hasta la puerta de enlace LLM que sirve como capa de acceso a los proveedores de LLM, que abarca las experiencias de los agentes, el marco de los agentes, el aprovechamiento de los agentes, la calidad de la IA, el gobierno y el cumplimiento de la IA, el acceso a la LLM y la gestión de costos de la LLM. Sus equipos también crearon Shepherd, la adaptación de Stripe de la plataforma de funciones de aprendizaje automático Chronon, y Chronon de código abierto en colaboración con Airbnb. Antes de Stripe, Chrissie ocupó puestos de liderazgo técnico e ingeniería senior en Google, Bloomberg y otras empresas tecnológicas líderes.

Mohan Musti

Mohan Musti

Mohan es gerente técnico principal de cuentas en AWS con sede en Dallas. Mohan ayuda a los clientes a diseñar y optimizar aplicaciones en AWS, especializándose en la gestión de operaciones complejas de IA/ML a escala. Con frecuencia contribuye a la comunidad de clientes de aprendizaje automático de AWS mediante el desarrollo de aplicaciones de referencia prácticas que resuelven desafíos de aprendizaje automático del mundo real. En su tiempo libre, le gusta pasar tiempo con su familia y acampar.

Hasan Tariq

Hasan Tariq

Hasan es arquitecto principal de soluciones en Amazon Web Services con sede en San Francisco. Trabaja con clientes de servicios financieros, ayudándolos a modernizar sus plataformas tecnológicas y crear soluciones innovadoras en AWS. Con más de 18 años de experiencia en la industria que cubre una amplia gama de tecnologías, Hasan aporta una profunda experiencia en el diseño de arquitecturas escalables de nivel de producción. Sus áreas de enfoque actuales incluyen agentes de codificación y comercio de agentes.