Procese documentos financieros utilizando Amazon Bedrock Data Automation

Las instituciones financieras procesan miles de documentos diariamente, incluidos formularios de impuestos, extractos de préstamos y órdenes de compra. Cada uno tiene un formato, estructura y nombres de campo únicos, lo que dificulta la creación de flujos de trabajo de automatización utilizando software de reconocimiento óptico de caracteres (OCR). Amazon Bedrock Data Automation (BDA) ayuda a resolver estos desafíos al automatizar la extracción, validación y análisis de datos de documentos financieros. BDA va más allá del simple OCR al utilizar modelos básicos que pueden:

Comprender el contexto del documento Reconocer las relaciones entre diferentes secciones Extraer datos estructurados y procesables Validar información en múltiples fuentes

Si bien los modelos básicos como Anthropic Claude pueden extraer contenido de archivos PDF, Amazon Bedrock Data Automation ofrece extracciones personalizadas con una precisión líder en la industria a un costo menor, junto con características como conexión a tierra visual con puntuaciones de confianza para la explicabilidad y mitigación de alucinaciones incorporada.

En esta publicación, exploramos cómo Amazon Bedrock Data Automation puede extraer información con precisión de cuatro tipos comunes de documentos financieros: extractos bancarios, formularios W-2, formularios de impuestos 1099-B y contratos de proveedores. Destacamos la complejidad de los documentos, detallamos la extracción personalizada creada en Amazon Bedrock Data Automation y describimos los resultados del proceso de extracción.

Descripción general de la solución

Amazon Bedrock Data Automation le permite configurar la salida según sus necesidades de procesamiento mediante planos. Un blueprint en Amazon Bedrock Data Automation es una plantilla de configuración que define cómo se deben extraer los datos de los documentos. Especifica:

El tipo de documento que se está procesando Los campos de datos que se extraerán Las reglas de validación para los datos extraídos La estructura y el formato de la salida

Piense en ello como un mapa que le dice a Amazon Bedrock Data Automation exactamente qué información buscar y cómo procesarla. Cuando utilice un plano para la extracción, puede utilizar un plano de catálogo o un plano creado personalizado. Un plano personalizado permite a las organizaciones crear patrones de extracción para sus necesidades específicas. En esta publicación, creamos planos personalizados y utilizamos la consola BDA para generar y validar el resultado.

Cómo desarrollar planos para 4 tipos de documentos financieros

Las siguientes secciones lo guiarán en la creación de planos personalizados para extractos bancarios, formularios W-2, formularios 1099-B y contratos de proveedores.

Requisitos previos

Si no está familiarizado con cómo se crean los planos personalizados, siga las instrucciones de la documentación de Amazon Bedrock. Para nuestra evaluación, cargamos los documentos en la consola BDA, refinamos las indicaciones generadas por IA y descargamos los resultados. Normalmente, un único plano personalizado es suficiente para un tipo de documento específico al extraer campos consistentes. Sin embargo, si los requisitos del flujo de trabajo varían o los formatos de los documentos cambian significativamente, es posible que sea necesario crear varios planos personalizados para adaptarse a estas diferencias. Una vez creado un blueprint, puede utilizarlo como parte del flujo de trabajo para un procesamiento posterior coherente. Para el mismo plano, si el documento de entrada tiene datos diferentes, entonces BDA podría devolver resultados ligeramente diferentes (por ejemplo, algunos extractos bancarios pueden tener débitos y créditos totales). Sin embargo, debido a que la salida de BDA está estructurada en JSON, es sencillo crear reglas apropiadas basadas en flujos de trabajo de procesamiento posteriores (por ejemplo, descartar el total si el flujo de trabajo debe categorizar transacciones individuales de débito y crédito para la contabilidad).

La siguiente captura de pantalla ilustra el mensaje del plano para uno de los tipos de documentos.

Configuración del mensaje de blueprint en la consola de Amazon Bedrock Data Automation

La siguiente sección describe los cuatro documentos probados como parte de este proyecto y la extracción lograda utilizando planos personalizados según las necesidades. Los resultados están disponibles en formatos JSON, CSV y datos sin procesar, lo que destaca la adaptabilidad de la solución a diversas necesidades de integración y generación de informes.

Tipos de documentos financieros y planos personalizados

Amazon Bedrock Data Automation proporciona planos integrados para tipos de documentos comunes, incluidos extractos bancarios y formularios W-2. Estos planos integrados ofrecen una extracción completa desde el primer momento. En esta publicación, utilizamos planos personalizados para demostrar cómo las organizaciones pueden adaptar la extracción a sus requisitos de flujo de trabajo específicos. Por ejemplo, puede extraer solo datos de transacciones de extractos bancarios para contabilidad automatizada o agrupar campos W-2 en estructuras lógicas (impuestos federales, impuestos estatales, pares de código-monto) que se alineen con los sistemas de procesamiento de impuestos posteriores. Los planos personalizados también sirven como enfoque para tipos de documentos que no tienen planos integrados, como los formularios 1099-B y los contratos de proveedores que se muestran más adelante en esta publicación.

1. Extractos bancarios: documentos de bancos que detallan la actividad financiera de una cuenta, incluidos depósitos, retiros y tarifas, durante un período específico, generalmente un mes.

Los extractos bancarios presentan un desafío complejo: contienen numerosas transacciones mensuales, que a menudo abarcan varias páginas, con diferentes formatos y detalles. En muchos flujos de trabajo, la tarea crítica es capturar con precisión los datos de las transacciones, incluidas fechas, montos, descripciones y números de referencia, que luego pueden alimentar directamente los flujos de trabajo contables automatizados, como la categorización de transacciones en un libro mayor contable. Esta extracción automatizada minimiza los errores de entrada manual de datos y agiliza el proceso de conciliación. Como parte de nuestro proceso de evaluación, seleccionamos el siguiente extracto bancario para probar el proceso de extracción:

Ejemplo de extracto bancario utilizado para pruebas de extracción

Estado de cuenta generado utilizando el modelo fundamental de Amazon Nova Pro

Instrucciones básicas personalizadas para Amazon Bedrock Data Automation:

Cree un plano de registro de transacciones con la siguiente estructura: Campo principal: – Transacciones: [TRANSACTION_DETAILS] Tipo personalizado: 1. Tipo TRANSACTION_DETAILS que contiene: – Fecha – Descripción – Débito: número – Crédito: número

Resultados de la extracción de table.csv:

Resultados de la extracción que muestran datos de transacciones en formato CSV

Tras la revisión, podemos confirmar que el sistema extrajo correctamente las transacciones con precisión.

2. Formulario W-2: informa los ingresos y los impuestos retenidos para un individuo o una empresa.

Los formularios de impuestos W-2 presentan desafíos de extracción únicos debido a su estructura estandarizada pero compleja. Como parte de nuestro proceso de evaluación, utilizamos el siguiente W-2 para una prueba del proceso de extracción:

Ejemplo de formulario W-2 utilizado para pruebas de extracción

W2 generado utilizando el modelo fundamental de Amazon Nova Pro

Instrucciones básicas personalizadas para Amazon Bedrock Data Automation:

Cree un plano detallado del formulario W2 con la siguiente estructura: Campos principales: – empleador_info: EmployerInfo – empleado_general_info: Empleado_info – federal_tax_info: FederalTaxInfo – federal_wage_info: FederalWageInfo – file_info: FilingInfo – state_taxes_table: [StateTaxInfo] – códigos: [CodeAmount] – nonqualified_plans_ Income: número – otros tipos personalizados: 1. EmployerInfo tipo que contiene: – ein – nombre_empleador – dirección_empleador – código_zip_empleado: número – número_control 2. Tipo de EmployeeInfo que contiene: – ssn – nombre – apellido_empleado – sufijo_nombre_empleado – dirección_empleado – código_zip_empleado: número 3. Tipo FederalWageInfo que contiene: – salarios_propinas_otra_compensación: número – salarios_seguridad_social: número – consejos_salarios_medicare: número – consejos_seguridad_social: número 4. Tipo FederalTaxInfo que contiene: – impuesto_federal_ingresos: número – impuesto_seguridad_social: número – impuesto_medicare: número – consejos_asignados: número 5. Tipo StateTaxInfo que contiene: – nombre_estado – número_id_estado_empleador: número – salarios_estado_y_propinas: número – impuesto_ingresos_estado: número – consejos_salarios_locales: número – impuesto_ingresos_locales: número – nombre_localidad 6. Tipo CodeAmount que contiene: – código – monto: número 7. Tipo FilingInfo que contiene: – número_omb – código_verificación

Resultados de la extracción de result.json:

Resultados de la extracción W-2 que muestran información del empleador y del empleado en formato JSON

Resultados de extracción W-2 que muestran información de impuestos y códigos en formato JSON

Tras la revisión, podemos confirmar que el sistema extrajo correctamente las transacciones con precisión. En el proyecto se verificaron específicamente varias complejidades de extracción:

No hay una agrupación específica en el formulario para la información de impuestos federales y estatales, pero deben procesarse juntos para que los resultados de la extracción los reúnan. En una sola casilla 12 del W2 puede haber hasta 26 códigos para informar ciertos montos de compensación y beneficios. Es importante extraer el código y el valor como un par. Los empleadores pueden poner casi cualquier cosa en el cuadro 14. Ayuda a detectar elementos que no tienen su propio cuadro exclusivo en el W-2, por lo que deben agruparse por separado.

3. Formulario 1099-B del IRS: Ingresos de transacciones de trueque y corredores: este documento fiscal rastrea:

Actividad de negociación de valores Transacciones facilitadas por corredores Participación en intercambios de trueque

Como parte de nuestro proceso de evaluación, utilizamos el siguiente 1099-B para una prueba del proceso de extracción:

Ejemplo de formulario 1099-B utilizado para pruebas de extracción

Declaración 1099-B generada utilizando el modelo fundamental de Amazon Nova Pro

Instrucciones básicas personalizadas para Amazon Bedrock Data Automation:

Cree un plano de transacción financiera con la siguiente estructura: tipo TRANSACTION_DETAILS que contenga: – descripción_de_seguridad – cantidad_vendida: número – fecha_adquirida – fecha_venta_o_disposición – ingresos: número – costo_u_otra_base: número – cantidad_ganancia_pérdida: número – información_adicional

Resultados de la extracción de table.csv:

Resultados de la extracción 1099-B que muestran los detalles de la transacción en formato CSV

Una validación significativa de las capacidades de comprensión contextual de BDA es que el sistema identificó y extrajo con precisión 'TSLA' como descriptor de seguridad en todas las transacciones de acciones, incluso si aparecía como un descriptor común para las transacciones. Esta extracción consistente demuestra la capacidad de BDA para mantener la precisión contextual durante todo el procesamiento de documentos.

4. Contrato de proveedor: este proceso de extracción es aplicable a una amplia gama de contratos de proveedores. Los detalles específicos que se capturarán deben adaptarse a los requisitos y flujos de trabajo operativos únicos de cada empresa.

Como parte de nuestro proceso de evaluación, seleccionamos el siguiente contrato de proveedor para una prueba del proceso de extracción:

Ejemplo de contrato de proveedor página 1

Ejemplo de contrato de proveedor página 2

Modelo de contrato de proveedor página 3

Modelo de contrato de proveedor página 4

Instrucciones básicas personalizadas para Amazon Bedrock Data Automation:

Cree un modelo de acuerdo con la siguiente estructura: Campos principales: – PARTICIPANT_DETAILS: PARTICIPANT_DETAILS – fecha_efectiva – time_period – participantes_requirements: PARTICIPANT_REQUIREMENTS – confidenciality_obligations – TERM_AND_TERMINATION: TERM_AND_TERMINATION Tipos personalizados: 1. Tipo PARTICIPANT_DETAILS que contiene: – participante_name – participante_representante_autorizado 2. Tipo PARTICIPANT_REQUIREMENTS que contiene: – recursos_asignados – obligaciones_participante – restricciones_participante 3. Tipo TERM_AND_TERMINATION que contiene: – término – condiciones_terminación

Resultados de la extracción de result.json:

Resultados de extracción de contratos de proveedores en formato JSON

El sistema identificó y extrajo con éxito los elementos especificados en el plano presentes en el contrato.

Conclusión

En esta publicación, demostramos cómo puede utilizar Amazon Bedrock Data Automation para extraer con precisión información clave de documentos financieros, incluidos extractos bancarios, formularios W-2, formularios 1099-B y contratos de proveedores para automatizar el procesamiento posterior. Aprendiste a:

Cree planos personalizados para diferentes tipos de documentos. Extraiga datos estructurados de documentos financieros complejos. Valide los resultados de Amazon Bedrock Data Automation para el procesamiento posterior.

Para obtener más información sobre la implementación del procesamiento de documentos con Amazon Bedrock, revise la documentación de Amazon Bedrock Data Automation. Para los flujos de trabajo de producción que involucran información confidencial, siga las pautas legales y de ciberseguridad de su organización para verificar el cumplimiento de todas las regulaciones aplicables, incluido, entre otros, el RGPD en Europa o cualquier otro requisito regional o específico de la industria.

Sobre los autores

Shivanshu Upadhyay

Shivanshu Upadhyay

Shivanshu es arquitecto principal de soluciones en el grupo AWS Industries. En este puesto, ayuda a los usuarios más avanzados de AWS a transformar su industria mediante el uso eficaz de datos e inteligencia artificial.

Ayu Shah

Ayu Shah

Ayu es arquitecto senior de soluciones en Amazon Web Services (AWS). Ayuda a los clientes nativos digitales a diseñar e implementar soluciones de inteligencia artificial generativa y aprendizaje automático (ML) en AWS. Ayu es un constructor que disfruta ayudar a los clientes a alcanzar sus objetivos comerciales y resolver desafíos complejos utilizando los servicios y las mejores prácticas de AWS. También aporta una amplia experiencia en redes y seguridad.