Cómo Amazon Finance agiliza las consultas regulatorias mediante el uso de IA generativa en AWS

Los equipos de tecnología financiera (FinTech) de Amazon crean y operan sistemas para que los equipos de Amazon gestionen consultas regulatorias de conformidad con diferentes jurisdicciones. Estos equipos procesan consultas regulatorias de las autoridades, cada una de las cuales presenta diferentes requisitos, formatos de documentos y niveles de complejidad.

Procesar estas consultas regulatorias implica revisar la documentación, extraer información relevante, recuperar datos de respaldo de múltiples sistemas dentro de la infraestructura de Amazon y compilar respuestas dentro de los plazos regulatorios. A medida que crecían la frecuencia de las consultas y la complejidad del negocio, Amazon necesitaba un enfoque más escalable.

En esta publicación, demostramos cómo los equipos de Amazon FinTech están utilizando Amazon Bedrock y otros servicios de AWS para crear una aplicación de IA escalable para transformar la forma en que se manejan las consultas regulatorias. Cada equipo que utiliza esta solución crea y mantiene su propia base de conocimientos dedicada, repleta de documentos y materiales de referencia específicos de ese equipo.

Desafíos

La escala y la complejidad de la gestión de consultas regulatorias presentaron varios desafíos interconectados:

Fragmentación del conocimiento y complejidad de la recuperación.

Las consultas regulatorias requieren sintetizar información de miles de documentos históricos. Estos documentos existen en varios formatos (PDF, PPT, Word, CSV) y contienen terminología específica del dominio. Los equipos necesitaban una manera de localizar rápidamente precedentes relevantes e información de respaldo en este vasto corpus, manteniendo al mismo tiempo la precisión y el cumplimiento normativo.

Contexto conversacional y gestión del estado.

Las consultas regulatorias requieren conversaciones de varios turnos donde el contexto de interacciones anteriores es esencial para generar respuestas precisas. Mantener el estado de la conversación a lo largo de las sesiones y rastrear la evolución de la respuesta a medida que los miembros del equipo refinan las respuestas a través de interacciones iterativas presenta una complejidad significativa.

Observabilidad y mejora continua

Con los sistemas de IA generativa, comprender por qué se generó una respuesta particular es tan importante como la respuesta misma. Los equipos necesitaban una visibilidad integral del proceso de recuperación, las decisiones del modelo y las interacciones de los usuarios para identificar áreas de mejora y mantener el cumplimiento de los principios de IA responsable. Por ejemplo, los equipos deben detectar cuando el modelo alucina información que no está presente en los documentos fuente, o detectar cuando el sistema recupera pautas de cumplimiento obsoletas que podrían conducir a violaciones regulatorias. Los sistemas de IA experimentan una variación de la precisión con el tiempo a medida que los modelos, las indicaciones y el corpus de documentos cambian, lo que requiere un monitoreo continuo.

Descripción general de la solución

Para abordar estos desafíos, el equipo de Amazon FinTech creó un sistema inteligente de automatización de respuesta regulatoria utilizando Amazon Bedrock, AWS Lambda y servicios de soporte de AWS. La solución implementa Retrieval Augmented Generation (RAG) con Amazon Bedrock Knowledge Bases y Amazon OpenSearch Serverless para almacenamiento vectorial, lo que permite la recuperación de información de miles de documentos históricos. Las interacciones de chat en tiempo real impulsadas por Claude Sonnet 4.5 a través de la API Converse Stream, combinadas con Amazon DynamoDB para la gestión del historial de conversaciones, brindan conversaciones de múltiples turnos contextualmente conscientes. La observabilidad integral a través de OpenTelemetry y Langfuse autohospedado garantiza el monitoreo y la mejora continuos del rendimiento del sistema de IA. El sistema no almacena en caché las respuestas del modelo de lenguaje grande (LLM) ni los resultados intermedios porque las consultas regulatorias son altamente contextuales y tienden a tener una tasa de aciertos de caché baja.

El siguiente diagrama muestra cómo puede utilizar las bases de conocimientos de Amazon Bedrock en un flujo de trabajo, junto con la API de Converse y otras herramientas, para proporcionar la información necesaria para consultas regulatorias:

Flujo de incorporación de la base de conocimientos

El flujo de ingesta de la base de conocimientos proporciona un proceso automatizado de documentos que se inicia después de que el usuario carga un documento. Su trabajo es incorporar los datos del documento en una base de conocimientos de Amazon Bedrock. Aquí está el flujo:

Puede utilizar el flujo de trabajo de ingesta de la base de conocimientos para cargar documentos de forma masiva y transformarlos en incrustaciones de vectores con capacidad de búsqueda a través de una canalización automatizada. El siguiente flujo detallado se ilustra en la figura anterior.

Carga de documentos por usuario: los usuarios cargan documentos a través de la aplicación del cliente. Generación de URL prefirmada: la aplicación cliente envía una solicitud a Amazon API Gateway, que invoca la función AWS Lambda de ingesta de la base de conocimientos para generar una URL S3 prefirmada. Carga de documentos: la aplicación cliente utiliza la URL prefirmada generada para cargar el documento. Activador de ingestión y procesamiento de datos: una vez que el documento se carga correctamente en Amazon Simple Storage Service (Amazon S3), la aplicación cliente activa Amazon API Gateway para iniciar el procesamiento de documentos en AWS Lambda, que maneja la conversión de formato y administra la ingesta simultánea de documentos. No necesitamos preprocesar las imágenes, gráficos y tablas de estos documentos porque la base de conocimientos de Amazon Bedrock está configurada con Amazon Bedrock Data Automation (BDA) para extraer eficazmente este contenido multimodal. Luego, la función AWS Lambda llama a las bases de conocimientos de Amazon Bedrock. Almacenamiento de vectores: la base de conocimientos de Amazon Bedrock fragmenta el contenido del documento mediante una estrategia de fragmentación jerárquica, genera incrustaciones mediante Amazon Titan Text Embeddings y almacena los vectores resultantes en OpenSearch Serverless. La fragmentación jerárquica crea relaciones padre-hijo anidadas que reflejan la estructura seccionada de los documentos financieros. Esta estrategia funciona bien para documentos estructurados y complejos porque indexa fragmentos pequeños para una recuperación precisa y, al mismo tiempo, devuelve fragmentos principales más grandes para proporcionar suficiente contexto para respuestas coherentes.

La creación de un canal de ingesta automatizado aborda el desafío principal de la fragmentación del conocimiento al procesar de manera eficiente miles de documentos históricos en múltiples formatos y al mismo tiempo optimizar la indexación de contenido para respuestas relevantes de IA. Este enfoque paralelizado permite que el sistema se escale de manera efectiva, acomodándose a la creciente actividad de investigación regulatoria año tras año, manteniendo al mismo tiempo un rendimiento de procesamiento consistente en grandes volúmenes de documentos.

Aplicación de chat

La aplicación de chat proporciona una interfaz de conversación en tiempo real impulsada por la arquitectura sin servidor de AWS, lo que permite interacciones en lenguaje natural con el sistema. Elegimos transmitir respuestas a los clientes para que puedan comenzar a leer la respuesta de IA antes en tiempo real, implementando esta capacidad a través de conexiones WebSocket. A través de estas conexiones WebSocket y el modelo Claude Sonnet 4.5, ofrece respuestas contextualmente relevantes mientras mantiene el estado de la conversación en DynamoDB. El flujo de trabajo funciona de la siguiente manera:

Iniciar conversación de chat: los usuarios inician o abren una sesión de chat existente a través de la aplicación cliente. Conexión WebSocket: la aplicación utiliza WebSockets para establecer una conexión bidireccional persistente con Amazon API Gateway. Envío de mensajes: la aplicación publica las preguntas del usuario a través de la conexión WebSocket que se propaga a la función AWS Lambda del servicio de chat. Mejora de consultas: la función AWS Lambda del servicio de chat utiliza el modelo Claude 3.5 Haiku con una estrategia de expansión de consultas para generar múltiples variaciones de la pregunta del usuario. Recuperación de conocimientos: Chat Service Lambda invoca la API de recuperación de bases de conocimientos de Amazon Bedrock para cada consulta ampliada. La API realiza búsquedas de similitud de vectores en el índice subyacente de OpenSearch Serverless y devuelve los fragmentos de documentos más relevantes junto con sus metadatos de origen y puntuaciones de relevancia. Ensamblaje de contexto: la función AWS Lambda del servicio de chat recupera el historial de conversaciones de Amazon DynamoDB (para conversaciones existentes, en función de ese ID de conversación específico) y lo combina con los resultados de la base de conocimientos recuperados y la pregunta del usuario. Generación de respuestas: la función AWS Lambda del servicio de chat utiliza la API Converse Stream con Claude Sonnet 4.5 y un mensaje de generador de respuestas para producir una respuesta contextualmente relevante basada en el contexto ensamblado. Participación del usuario: la función AWS Lambda del servicio de chat transmite la respuesta generada a la aplicación cliente en formato Markdown a través de la conexión WebSocket y almacena toda la conversación en la tabla de historial de conversación de Amazon DynamoDb. Observabilidad: durante todo el proceso, el servicio de chat publica seguimientos de un extremo a otro en una instancia de Langfuse autohospedada utilizando el SDK de OpenTelemetry (OTEL). Esto captura datos de telemetría detallados, incluidas métricas de latencia, uso de tokens, plantillas de mensajes y respuestas de modelos.

Experiencia conversacional de múltiples turnos

Las discusiones sobre consultas regulatorias a menudo avanzan a través de múltiples intercambios a medida que los equipos perfeccionan las respuestas y hacen referencia a fuentes de datos adicionales. Para respaldar este proceso iterativo, el equipo de Amazon FinTech implementó un flujo de trabajo conversacional de múltiples turnos utilizando Amazon API Gateway (API WebSocket), AWS Lambda y Amazon DynamoDB, integrado con la API ConverseStream de Amazon Bedrock para un diálogo de baja latencia y consciente del contexto. Cada sesión de chat se autentica de forma segura a través de Amazon Cognito y se le asigna un ID de conversación único. DynamoDB almacena los mensajes en orden cronológico para preservar el contexto entre sesiones, de modo que los usuarios puedan reanudar discusiones anteriores sin problemas y mantener la continuidad.

Cuando un usuario envía una consulta, el sistema desinfecta las entradas para evitar ataques de inyección rápidos. Después de la desinfección, el sistema clasifica la intención y determina si es necesaria la recuperación de la base de conocimientos de Amazon Bedrock. Esta determinación se realiza a través de una llamada LLM que clasifica la consulta del usuario como conversacional o intensiva en conocimientos. Para preguntas complejas que requieren mucho conocimiento, el flujo de trabajo emplea una estrategia de expansión de consultas que aborda el uso predominante de acrónimos y preguntas abreviadas por parte de los usuarios. Esta capa genera hasta cinco variaciones de consultas usando Claude 3.5 Haiku, luego realiza llamadas paralelas de API de recuperación a la base de conocimientos, recuperando resultados relevantes usando la búsqueda de similitud de vectores OpenSearch. Para mantener el rendimiento a escala, el flujo de trabajo implementa un procesamiento paralelo para estas llamadas de recuperación mediante subprocesos múltiples. Esta optimización redujo la latencia de recuperación de 10 segundos (procesamiento secuencial) a menos de 2 segundos, lo que permitió conversaciones receptivas. La información recuperada, combinada con el historial de conversaciones recientes, se pasa a Claude Sonnet 4.5 a través de la API ConverseStream aumentada con Amazon Bedrock Guardrails, que implementa filtros de información confidencial para detectar y eliminar automáticamente PII y datos financieros tanto de entradas como de salidas. Esto es fundamental para proteger la documentación reglamentaria. Cuando se detectan intentos de inyección rápidos, el sistema responde con "Lo siento, el modelo no puede responder esa pregunta", manteniendo interacciones seguras y conformes al mismo tiempo que mantiene la fluidez conversacional.

Esta arquitectura ofrece continuidad, transparencia y escalabilidad. Los usuarios reciben respuestas en tiempo real con actualizaciones de estado durante las fases de recuperación y generación, lo que mejora la participación y reduce la latencia. Los registros persistentes en DynamoDB proporcionan un seguimiento de auditoría inmutable para la revisión del cumplimiento, mientras que el diseño sin servidor y basado en eventos se escala automáticamente para admitir sesiones simultáneas. Juntas, estas capacidades permiten al equipo de Amazon FinTech llevar a cabo conversaciones complejas e iterativas, produciendo respuestas contextualmente relevantes, seguras y que cumplen con las normativas impulsadas por Amazon Bedrock.

Observabilidad

La observabilidad juega un papel fundamental en la comprensión y mejora de los flujos de trabajo impulsados ​​por la IA. Para lograr una visibilidad completa del sistema de respuesta a consultas regulatorias, el servicio de chat AWS Lambda integró OpenTelemetry (OTEL) con una instancia de Langfuse autohospedada para capturar seguimientos detallados de un extremo a otro de cada interacción. Esta configuración proporciona a los ingenieros y científicos aplicados telemetría detallada sobre cómo se procesan las indicaciones, se recuperan los conocimientos y se generan las respuestas. Esto permite un refinamiento casi continuo del rendimiento y la precisión del sistema. La decisión de utilizar OTEL en lugar del SDK nativo de Langfuse proporciona flexibilidad neutral para el proveedor, lo que permite enrutar los datos de telemetría a múltiples backends de observabilidad y adaptarlos a los requisitos de monitoreo en evolución.

En tiempo de ejecución, cada etapa del servicio de chat AWS Lambda se instrumenta manualmente utilizando el SDK de Java de OTEL para registrar la latencia, el uso de tokens, las decisiones de modelo y los metadatos rápidos en el estándar semántico de IA generativa de OTEL. Los intervalos se publican en Langfuse casi en tiempo real, lo que brinda al equipo una visión transparente de cómo interactúan la API ConverseStream de Amazon Bedrock, la recuperación de la base de conocimientos y Claude Sonnet 4.5 en una sola solicitud. La telemetría detallada permite al equipo identificar cuellos de botella en el rendimiento, optimizar las estrategias rápidas y mejorar la precisión de la recuperación mientras se mantienen prácticas responsables de IA.

Este marco de observabilidad mantiene la confianza y la responsabilidad en el comportamiento del sistema. Los ingenieros pueden correlacionar las acciones del usuario con los resultados del modelo, rastrear el linaje de datos en múltiples servicios y ajustar las configuraciones sin interrumpir las operaciones. Al combinar la interoperabilidad de OpenTelemetry con la visualización y el análisis de Langfuse, el equipo de Amazon FinTech obtiene una base escalable y extensible para evaluar sistemas de IA generativa a escala, convirtiendo cada interacción en información procesable para la mejora continua.

La siguiente captura de pantalla ilustra un seguimiento de un extremo a otro capturado en Langfuse y muestra cómo la solución de observabilidad captura el flujo de trabajo completo, desde la expansión de consultas y la recuperación de conocimientos hasta las indicaciones, respuestas y métricas de latencia del modelo. También destaca las citas de documentos fuente, ofreciendo una vista transparente de cómo la información contextual fluye a través del sistema durante la generación de respuestas.

ML-19907-langfuse

Referencia: Seguimiento de un extremo a otro Publicado en Langfuse

Conclusión

En esta publicación, vio cómo el equipo de Amazon FinTech creó una solución de IA escalable utilizando Amazon Bedrock, diseñada para respaldar consultas regulatorias mediante la automatización de la recuperación de conocimientos, los flujos de trabajo conversacionales y la generación de respuestas. Al combinar un proceso de ingesta de documentos, conversaciones con estado de varios turnos y observabilidad detallada a través de OpenTelemetry y Langfuse, la arquitectura permite a los equipos manejar consultas regulatorias de manera gobernada, rastreable y compatible.

Dado que toda la pila se basa en servicios sin servidor de AWS, ofrece la escalabilidad operativa, la seguridad y la elasticidad necesarias para una implementación de nivel empresarial. Ya sea que se trate de cumplimiento legal, consultas regulatorias o flujos de trabajo de conocimiento interno de gran volumen, este patrón ofrece una base práctica que puede adaptar y ampliar a su dominio empresarial.

Si está listo para modernizar sus procesos intensivos en conocimiento con IA generativa, explore la documentación de Amazon Bedrock para descubrir cómo puede comenzar a crear sus propios flujos de trabajo seguros, gobernados y escalables impulsados ​​por IA.

Sobre los autores

balaji

Balajikumar Gopalakrishnan

Balajikumar es ingeniero principal en Amazon Finance Technology. Ha estado en Amazon desde 2013, resolviendo desafíos del mundo real a través de tecnología que impacta directamente las vidas de los clientes de Amazon. Fuera del trabajo, a Balaji le gusta hacer senderismo, pintar y pasar tiempo con su familia. ¡Él también es un cinéfilo!

Biswajit

Biswajit Mohapatra

Biswajit es ingeniero de datos sénior en Amazon, donde aprovecha sus 7 años de experiencia como desarrollador para crear soluciones integrales que ayuden en los procesos de cumplimiento. Antes de Amazon, Biswajit trabajó mucho en la creación de soluciones de transmisión en tiempo real para sistemas HealthCare. Cuando no está diseñando soluciones, a Biswajit le gusta viajar y descubrir la cocina local.

Pramodh

Pramodh Korukonda

Pramodh es ingeniero senior de desarrollo de software en Amazon Finance Technology. Es amazónico desde 2013, comenzó su andadura resolviendo problemas para proveedores y pequeñas empresas de Amazon, y ahora se centra en los equipos de Finanzas de Amazon. Fuera del trabajo, le gusta cocinar para sus seres queridos y explorar la comida local a través de sus viajes.

jeff

Jeff Rebacz

Jeff es ingeniero senior de desarrollo de software en Amazon y crea automatización de recopilación de datos y documentos para procesos de auditoría fiscal desde 2019. Antes de Amazon, Jeff trabajó en el espacio de automatización industrial desarrollando una base de datos de series temporales para el monitoreo de activos. A Jeff le gusta mantenerse activo jugando voleibol y haciendo caminatas. También tiene la afición práctica de arreglar coches.

yunfei bai

yunfei bai

Yunfei es arquitecto principal de IA aplicada en AWS. Con experiencia en IA/ML, ciencia de datos y análisis, Yunfei ayuda a los clientes a adoptar los servicios de AWS para ofrecer resultados comerciales. Diseña soluciones de análisis de datos y IA/ML que superan desafíos técnicos complejos e impulsan objetivos estratégicos. Yunfei tiene un doctorado en Ingeniería Electrónica y Eléctrica. Fuera del trabajo, a Yunfei le gusta la lectura y la música.