Las organizaciones procesan millones de documentos diariamente, desde reclamaciones de seguros y facturas hasta contratos legales y registros médicos. Si bien las soluciones tradicionales de reconocimiento óptico de caracteres (OCR) extraen texto, no pueden comprender el contexto, las relaciones o el significado incrustados en documentos complejos. Esta limitación crea cuellos de botella que requieren intervención manual, lo que aumenta el tiempo y los costos de procesamiento e introduce errores potenciales.
Amazon Bedrock Data Automation (BDA) proporciona una experiencia API unificada para extraer información significativa de contenido multimodal, incluidos documentos, imágenes, vídeos y archivos de audio. A diferencia de las soluciones tradicionales que se centran en la extracción de texto, BDA comprende el contexto del documento, valida los datos extraídos y proporciona puntuaciones de confianza en cuanto a precisión. BDA procesa documentos a través de un canal que automatiza tareas complejas que incluyen clasificación, extracción, normalización y validación de documentos. Cuando se envía un documento, BDA lo divide automáticamente según límites lógicos, clasifica cada sección en tipos de documentos apropiados y los relaciona con los planos de procesamiento correctos. Este enrutamiento inteligente elimina la necesidad de clasificar documentos manualmente y orquestar múltiples modelos de IA. El servicio admite una amplia gama de formatos de archivo, con soporte para hasta 3000 páginas y 500 MB por solicitud de API, lo que lo hace adecuado para procesar diversos tipos de documentos a escala.
Esta publicación describe el desarrollo de un proceso de procesamiento de documentos inteligente escalable y rentable en AWS, impulsado por Amazon Bedrock y sus características. BDA es un servicio administrado dentro de Amazon Bedrock que automatiza la extracción de información de documentos. Demostramos cómo BDA extrae y analiza el contenido de los documentos, mientras que Strands Agent alojado en Amazon Bedrock AgentCore Runtime coordina tareas de procesamiento especializadas y Amazon Bedrock Knowledge Base permite la comprensión contextual en múltiples documentos. Al combinar estas capacidades dentro de una arquitectura unificada, las organizaciones pueden transformar sus flujos de trabajo de procesamiento de documentos con un mínimo esfuerzo de desarrollo.
Descripción general de la solución
Nuestro proceso de procesamiento de documentos inteligente combina IA generativa con flujos de trabajo orquestados para extraer, analizar automáticamente diagramas visuales, gráficos y cuadros, y obtener información de los documentos mientras mantiene el contexto y las relaciones entre múltiples fuentes de datos. La solución procesa documentos a través de cuatro capas integradas:
Capa de procesamiento de entrada: la carga de documentos desencadena la orquestación del procesamiento y la coordinación de la máquina de estados. Capa de extracción y almacenamiento: extracción de texto sin formato y tablas, análisis de imágenes y elementos visuales e integración de datos escalables. Capa de inteligencia: incorporación de la base de conocimientos con búsqueda semántica, análisis del modelo básico multimodal (FM) e interpretación basada en modelos de lenguaje grande (LLM). Capa de coordinación agente: Agente coordinador y agentes de tareas especializados.
Componentes de arquitectura
Capa de procesamiento de entrada
La capa de procesamiento de entrada forma la base de esta solución. Esta capa gestiona la recepción inicial y el enrutamiento de los documentos entrantes. Una carga de documentos desencadena flujos de trabajo de procesamiento cuando los documentos llegan a los depósitos designados de Amazon Simple Storage Service (Amzon S3), que admiten varios formatos, incluidos PDF y documentos escaneados (en PDF).
BDA sirve como motor de extracción central en la capa de procesamiento de entrada, manejando la división, clasificación y extracción de contenido de documentos a través de una API unificada. AWS Step Functions organiza el flujo de trabajo para maximizar las capacidades de BDA en la capa de extracción y almacenamiento, proporcionando visibilidad operativa y control durante todo el proceso. Aquí está el flujo de orquestación detallado:
Ingestión de documentos: los archivos llegan a depósitos de S3 en varios formatos. Cada formato se procesa a través de la API unificada, lo que elimina la necesidad de un preprocesamiento específico del formato. Registro de metadatos: los registros de flujo de trabajo documentan metadatos en Amazon DynamoDB para seguimiento, seguimientos de auditoría e informes. Esto incluye el tipo de archivo, el tamaño, el tiempo de envío y el estado de procesamiento. Análisis del recuento de páginas: el flujo de trabajo comprueba el recuento de páginas para mejorar las estrategias de procesamiento. BDA maneja automáticamente la división de documentos y puede procesar documentos de hasta 3000 páginas. La verificación del recuento de páginas en Step Functions ayuda a establecer valores de tiempo de espera adecuados para los trabajos asincrónicos y a monitorear y alertar sobre documentos inusualmente grandes. Invocación de procesamiento de BDA: el flujo de trabajo inicia un trabajo de BDA asincrónico mediante la API InvokeDataAutomationAsync. Luego, BDA automáticamente: Divide los documentos según límites lógicos (hasta 20 páginas por división). Clasifica cada sección en tipos de documentos. Hace coincidir los documentos con los planos apropiados (si se utiliza una salida personalizada). Los blueprints son artefactos configurados con anticipación que definen la lógica de extracción y deben configurarse antes del procesamiento BDA. Extrae todo el contenido, incluidos texto, tablas, formularios y elementos visuales. Procesamiento asincrónico con tokens de tarea: el flujo de trabajo almacena un token de tarea y espera a que se complete el trabajo de BDA. Este patrón permite una utilización eficiente de los recursos y permite el procesamiento de miles de documentos simultáneamente. Manejo y enrutamiento de errores: el manejo integral de errores administra diferentes escenarios, incluido el procesamiento exitoso, errores de validación, tiempos de espera y tipos de archivos no admitidos, lo que garantiza que no se pierda ningún documento y que todos los problemas se registren para su revisión.
Este enfoque de orquestación proporciona una canalización sin servidor altamente escalable para el análisis automatizado de documentos con una lógica de ramificación adecuada y gestión de excepciones en cada etapa de procesamiento.
Capa de extracción y almacenamiento.
Esta capa es fundamental para esta solución, donde BDA sirve como motor central para transformar contenido sin procesar en datos estructurados y procesables. Proporcionamos más detalles en la siguiente sección.
Amazon Bedrock Data Automation actúa como motor de procesamiento principal y ofrece dos opciones de salida flexibles:
Salida estándar: proporciona información comúnmente requerida según el tipo de datos, incluidos resúmenes de documentos, texto extraído en orden de lectura, títulos de tablas y figuras, e información generativa. La salida estándar se puede personalizar a través de proyectos para habilitar o deshabilitar funciones de extracción específicas como encabezados, pies de página, títulos y diagramas según sus necesidades de procesamiento. Salida personalizada con planos: la idea es crear un plano por tipo de documento, ya que se utiliza el mismo conjunto de instrucciones para extraer información común entre documentos del mismo tipo. Sin embargo, entre diferentes tipos de documentos, se necesitan planos diferentes para información diferente. Por ejemplo, desea extraer información diferente de un pasaporte que de un extracto bancario, por lo que estos dos tipos de documentos requieren planos separados. Todos los extractos bancarios deben procesarse con un solo modelo porque, independientemente del banco o formato, el tipo de información que desea extraer de los extractos bancarios debe ser el mismo. Los planos permiten un control preciso sobre la información extraída mediante la definición de campos, formatos de datos e instrucciones de extracción específicos. Los proyectos pueden contener hasta 40 planos de documentos, y BDA relaciona automáticamente cada documento con el plano apropiado. Esto permite el procesamiento de diversos tipos de documentos como facturas, contratos y formularios dentro de un único flujo de trabajo unificado.
Además, BDA proporciona:
Experiencia API unificada para procesar contenido multimodal a través de una única interfaz Capacidad de inferencia entre regiones en varias regiones para mejorar el procesamiento Protección integrada, incluida la base visual y puntuaciones de confianza para mayor precisión Compatibilidad con planos personalizados para estandarizar formatos de salida para tipos de documentos específicos
El procesamiento de análisis visual utiliza las capacidades de BDA para extraer información de gráficos, diagramas, cuadros y elementos visuales que las soluciones tradicionales de reconocimiento óptico de caracteres (OCR) no pueden interpretar. BDA proporciona recortes de imágenes como parte del resultado al realizar subtítulos de figuras y también genera descripciones textuales detalladas y datos estructurados a partir de estos elementos visuales que se incluyen en el flujo de trabajo posterior. Por ejemplo, cuando BDA procesa un gráfico, produce:
Leyendas generadas que describen el contenido y el propósito del gráfico Puntos de datos extraídos y tendencias de gráficos Relaciones estructurales de diagramas y diagramas de flujo Coordenadas del cuadro delimitador que vinculan el elemento visual con su ubicación en el documento
Todos los formatos de documentos en procesamiento posterior: todos los formatos de documentos admitidos (PDF, PNG, JPG, TIFF, DOC, DOCX) se procesan a través de la API unificada. El contenido extraído de BDA, incluidas las descripciones de elementos visuales, se puede configurar manualmente para indexación y vectorización en Amazon Bedrock Knowledge Bases para permitir la búsqueda semántica en diversos tipos de documentos. Tenga en cuenta que BDA también tiene una integración incorporada con las bases de conocimiento donde puede servir como analizador durante la ingesta de documentos en una base de conocimiento, utilizando la salida estándar de BDA (no se requieren planos). Este flujo de trabajo posterior recibe salidas JSON estructuradas de BDA que contienen toda la información extraída, lo que permite un procesamiento consistente independientemente del formato del archivo original.
La extracción de datos de documentos incluye:
Extracción de texto en orden de lectura con preservación del diseño Reconocimiento de estructura de tabla con relaciones de celda mantenidas Detección de campos de formulario y extracción de pares clave-valor Análisis de elementos visuales que incluyen tablas, gráficos y diagramas con subtítulos generados Coordenadas del cuadro delimitador para un seguimiento preciso de la ubicación de los elementos extraídos Resúmenes a nivel de documento y de página con preservación de contexto
Capa de inteligencia
Esta capa es el motor cognitivo de esta solución. Las bases de conocimiento de Amazon Bedrock deben configurarse para funcionar con Amazon OpenSearch Serverless para transformar el contenido sin procesar en información procesable a través de capacidades de búsqueda semántica y generación aumentada de recuperación (RAG). La siguiente sección proporciona más detalles.
Amazon Bedrock Knowledge Bases con Amazon OpenSearch Serverless permite la búsqueda semántica y los flujos de trabajo RAG al:
Indexación del contenido de documentos procesados para consultas inteligentes Mantenimiento de incrustaciones de vectores para búsquedas de similitudes en colecciones de documentos Admite consultas complejas que abarcan múltiples documentos y fuentes de datos
Amazon Bedrock FM analiza contenido visual, incluida la interpretación de cuadros y gráficos, la comprensión del diseño de documentos y la detección de relaciones intermodales entre texto y componentes visuales.
Capa de coordinación agente
Esta capa organiza la inteligencia de esta solución. Los agentes de Strands en Amazon Bedrock AgentCore Runtime administran el flujo de trabajo de procesamiento general enrutando las solicitudes a los agentes especializados adecuados según el tipo de solicitud y coordinando la comunicación entre agentes para el análisis de documentos complejos.
Los agentes de tareas especializados se encargan de funciones específicas de procesamiento de documentos:
Agentes analistas de mercado para informes de mercados financieros y documentos de inversión. Agentes asesores de inversiones para análisis de carteras y documentación de asesoramiento. Agentes API externos para la integración de datos de terceros en tiempo real a través de conexiones API seguras a proveedores de datos financieros, bases de datos regulatorias y plataformas de inteligencia de mercado. Los agentes coordinadores realizan una validación de referencias cruzadas comparando datos de mercado en tiempo real de los agentes API externos con datos históricos almacenados en la base de conocimiento de Amazon Bedrock.
Arquitectura de implementación
El proceso de procesamiento emplea un enfoque basado en eventos para el procesamiento de documentos, integrando múltiples capas especializadas en un flujo de trabajo cohesivo. Sigue una progresión lógica donde cada paso se basa en el anterior. Esto comienza con la carga de documentos, desencadenando eventos de Amazon S3 que inician máquinas de estado y avanzando a través del procesamiento multimodal que extrae significado de diversos tipos de contenido. El proceso continúa con la coordinación de agentes que dirige el procesamiento en función de las características del documento, seguido de la indexación de la base de conocimientos para la recuperación inteligente. Este flujo metódico culmina en la generación e integración de conocimientos con sistemas empresariales, creando un recorrido de procesamiento integral desde documentos sin procesar hasta inteligencia procesable.
Flujo de procesamiento de documentos
AWS Step Functions organiza el proceso de procesamiento de documentos, manejando la clasificación de documentos, la extracción multimodal, la validación de datos y la integración de la base de conocimientos.
Flujo de interacción agente
La capa de cara al usuario proporciona procesamiento inteligente de consultas a través de la interacción del lenguaje natural con el corpus de documentos procesados, la supervisión del agente de coordinación de agentes especializados y la distribución inteligente de consultas a los agentes de procesamiento adecuados.
Tutorial de la solución
Caso de uso: análisis de propiedades de bienes raíces comerciales
Una empresa de inversión en bienes raíces comerciales recibe mensualmente más de 200 informes de evaluación de propiedades. Estos informes contienen:
Documentos de descripción general de la propiedad con mapas de ubicación, información de zonificación y descripciones de la propiedad. Hojas de cálculo de análisis financiero integradas como imágenes en archivos PDF, que muestran proyecciones de flujo de caja, tasas de capitalización y cálculos de ROI. Gráficos comparativos de mercado que muestran ventas de propiedades, tasas de alquiler y tendencias del mercado comparables. Fotos de la propiedad y planos de planta con anotaciones y medidas. Documentos legales, incluidos informes de títulos, evaluaciones ambientales y cumplimiento de zonificación. Gráficos de rendimiento histórico que muestran tasas de ocupación, listas de alquileres y costos de mantenimiento a lo largo del tiempo.
El analista accede a esta solución, carga los documentos en ella.
Implementación
Esta implementación muestra cómo nuestros servicios de IA generativa pueden transformar el análisis de inversiones inmobiliarias a través de capacidades de procesamiento de documentos haciendo lo siguiente:
Clasificación de documentos: el sistema identifica automáticamente los tipos de documentos, extrae metadatos de propiedad (incluida la dirección y los pies cuadrados) y envía diferentes secciones de documentos a los agentes de procesamiento adecuados.
Extracción de contenido multimodal:
Los agentes analistas de mercado procesan gráficos financieros integrados para extraer proyecciones de ingresos operativos netos y tendencias de las tasas de capitalización. Las capacidades visuales de Amazon Bedrock Data Automation analizan fotografías de propiedades para identificar indicadores de condición y ratios de eficiencia de planos de planta. El análisis de relaciones entre documentos valida los flujos de efectivo proyectados con datos históricos de desempeño.
Consultas en lenguaje natural: los profesionales de la inversión procesan información mediante consultas en lenguaje natural, como "Muéstrame propiedades con una TIR proyectada superior al 12% y índices de cobertura de deuda superiores a 1,25" o "Compara las proyecciones de crecimiento del NOI con el desempeño real del mercado para activos similares".
Resultados
El tiempo de procesamiento por propiedad se redujo de 3 a 4 horas a 15 a 20 minutos para la evaluación inicial. La extracción automatizada elimina los errores de transcripción manual, mientras que la validación entre documentos identifica inconsistencias. La empresa puede procesar muchas más oportunidades e identificar inversiones atractivas que de otro modo podrían pasarse por alto.
Validación de escalabilidad: esta solución se ha probado a escala y ha procesado con éxito más de 50 000 documentos PDF simultáneamente a través del canal BDA. La solución mantuvo una alta precisión en diversos tipos de documentos, incluidos contratos, informes financieros y especificaciones técnicas, mientras se procesaba a escala. La arquitectura sin servidor con AWS Step Functions y el procesamiento BDA asíncrono permitieron esta enorme capacidad de procesamiento paralelo sin degradación del rendimiento, lo que demuestra la preparación de la solución para cargas de trabajo de procesamiento de documentos a escala empresarial.
Despliegue
La implementación completa del AWS Cloud Development Kit (AWS CDK) proporciona toda la arquitectura con principios de infraestructura como código (IaC). La implementación crea cuatro componentes de pila principales alineados con nuestras capas de arquitectura e incluye configuraciones específicas del entorno para entornos de desarrollo, ensayo y producción.
Requisitos previos
Antes de implementar esta solución, asegúrese de tener:
Una cuenta de AWS con los permisos adecuados para crear roles de IAM, funciones de AWS Lambda, Step Functions, Amazon DynamoDB, Amazon Elastic Container Rregistry (Amazon ECR) y depósitos de S3. Acceso a Amazon Bedrock FM habilitados en la región de AWS donde desea implementar su solución. Amazon Bedrock Data Automation habilitado en una región disponible. Actualmente, BDA está disponible en ocho regiones: Europa (Frankfurt), Europa (Londres), Europa (Irlanda), Asia Pacífico (Mumbai), Asia Pacífico (Sídney), EE. UU. Oeste (Oregón), EE. UU. Este (Norte de Virginia) y AWS GovCloud (EE. UU. Oeste). Familiaridad básica con AWS CDK y Python para la implementación de infraestructura. Comprensión de los flujos de trabajo de procesamiento de documentos y los requisitos comerciales. Documentos de muestra para pruebas y validación.
La implementación completa de CDK está disponible en nuestro repositorio público de GitHub: Procesamiento inteligente de documentos con Bedrock Agents.
Para implementar esta solución, ejecute el siguiente comando:
# Implementación de inicio rápido git clone https://github.com/aws-samples/sample-pdf-to-insights-idp-solution cd sample-pdf-to-insights-idp-solution ./deploy.sh –profile default –environment UAT
Estrategias de optimización de costos
Los siguientes son enfoques reflexivos para gestionar los gastos operativos manteniendo al mismo tiempo la eficacia del procesamiento de esta solución.
Enrutamiento inteligente
Enrute los documentos a niveles de procesamiento apropiados según la complejidad. Los documentos de texto simples utilizan extracción básica, mientras que los documentos complejos con tablas e imágenes emplean técnicas de procesamiento más avanzadas.
Procesamiento por lotes
Combine varios documentos en una única solicitud de Amazon Bedrock Data Automation cuando corresponda para mejorar los costos respetando los límites del servicio.
Gestión del ciclo de vida del almacenamiento
Implemente políticas de ciclo de vida de Amazon S3 para realizar la transición automática de los documentos procesados a niveles de almacenamiento de menor costo según los patrones de acceso.
Seguridad y cumplimiento
La arquitectura incorpora seguridad de nivel empresarial a través de claves AWS KMS para el cifrado de documentos y resultados de procesamiento, conectividad AWS PrivateLink para acceso seguro a API dentro de los límites de VPC y funciones de IAM con principios de acceso con privilegios mínimos en todos los componentes.
Limpiar
Para evitar cargos continuos, elimine los recursos creados por esta solución:
Elimine las pilas de AWS CDK en orden inverso de dependencia. Vacíe y elimine los depósitos de S3 que contienen documentos procesados. Elimine los agentes y las bases de conocimiento de Amazon Bedrock. Elimine los grupos y métricas de Amazon CloudWatch Log.
Para eliminar todos los recursos creados, ejecute este comando:# Cleanup development./cleanup.sh –profile default –environment UAT
Conclusión
Las organizaciones pueden utilizar Amazon Bedrock Data Automation, combinado con una arquitectura de coordinación basada en agentes para automatizar el procesamiento de documentos desde un centro de costos tradicional hasta convertirlo en un activo comercial estratégico. Al extraer y analizar automáticamente diagramas, gráficos y tablas visuales, y obtener información de los documentos mientras se mantiene el contexto y las relaciones entre las fuentes de datos, las organizaciones pueden desbloquear el valor que antes estaba atrapado en contenido no estructurado. La arquitectura multicapa proporciona una base para el procesamiento de documentos escalable y rentable que se adapta a diferentes cargas de trabajo manteniendo una alta precisión. Las capacidades de análisis visual brindan información valiosa integrada en cuadros, gráficos e imágenes y se capturan y se ponen a disposición para la inteligencia empresarial y la toma de decisiones. Comience con una prueba de concepto enfocada que se dirija a los tipos de documentos y requisitos de análisis visual más comunes. Luego, amplíe la solución a medida que adquiera experiencia con los servicios y comprenda sus requisitos específicos de precisión y rendimiento.
Para obtener más información sobre Amazon Bedrock Data Automation, visite la documentación de Amazon Bedrock Data Automation. Para obtener experiencia práctica con el procesamiento inteligente de documentos, explore el taller IDP en GitHub. El código de implementación de CDK completo para esta arquitectura está disponible en el repositorio de muestras de AWS con instrucciones de implementación y ejemplos de configuración.