Avances en la comprensión de documentos – Google Research Blog

Los últimos años han visto un rápido progreso en los sistemas que pueden procesar automáticamente documentos comerciales complejos y convertirlos en objetos estructurados. Un sistema que puede extraer datos automáticamente de documentos, por ejemplo, recibos, cotizaciones de seguros y estados financieros, tiene el potencial de mejorar drásticamente la eficiencia de los flujos de trabajo comerciales al evitar el trabajo manual propenso a errores. Modelos recientes, basados ​​en la Transformador arquitectura, han demostrado ganancias impresionantes en precisión. Los modelos más grandes, como PALMA 2, también se están aprovechando para optimizar aún más estos flujos de trabajo comerciales. Sin embargo, los conjuntos de datos utilizados en la literatura académica no logran capturar los desafíos que se ven en los casos de uso del mundo real. En consecuencia, los puntos de referencia académicos informan una gran precisión del modelo, pero estos mismos modelos funcionan mal cuando se utilizan para aplicaciones complejas del mundo real.

En “VRDU: un punto de referencia para la comprensión de documentos visualmente ricos”, presentado en KDD 2023anunciamos el lanzamiento del nuevo Comprensión de documentos visualmente ricos (VRDU) conjunto de datos que tiene como objetivo cerrar esta brecha y ayudar a los investigadores a realizar un mejor seguimiento del progreso en las tareas de comprensión de documentos. Enumeramos cinco requisitos para un buen punto de referencia de comprensión de documentos, en función de los tipos de documentos del mundo real para los que se utilizan con frecuencia los modelos de comprensión de documentos. Luego, describimos cómo la mayoría de los conjuntos de datos utilizados actualmente por la comunidad de investigación no cumplen con uno o más de estos requisitos, mientras que VRDU los cumple con todos. Estamos emocionados de anunciar el lanzamiento público de la VRDU conjunto de datos y código de evaluación debajo de Licencia Creative Commons.

Requisitos de referencia

Primero, comparamos la precisión del modelo de última generación (p. ej., con FormNet y DiseñoLMv2) en casos de uso del mundo real a puntos de referencia académicos (por ejemplo, FUNSD, CABLE, SROIE). Observamos que los modelos de última generación no coincidían con los resultados académicos de referencia y ofrecían una precisión mucho menor en el mundo real. A continuación, comparamos conjuntos de datos típicos para los cuales los modelos de comprensión de documentos se usan con frecuencia con puntos de referencia académicos e identificamos cinco requisitos de conjuntos de datos que permiten que un conjunto de datos capture mejor la complejidad de las aplicaciones del mundo real:

  • Esquema rico: En la práctica, vemos una amplia variedad de esquemas ricos para la extracción estructurada. Las entidades tienen diferentes tipos de datos (numéricos, cadenas, fechas, etc.) que pueden ser obligatorios, opcionales o repetidos en un solo documento o incluso anidados. Las tareas de extracción sobre esquemas planos simples como (encabezado, pregunta, respuesta) no reflejan los problemas típicos que se encuentran en la práctica.
  • Documentos ricos en diseño: Los documentos deben tener elementos de diseño complejos. Los desafíos en los entornos prácticos provienen del hecho de que los documentos pueden contener tablas, pares clave-valor, cambiar entre el diseño de una columna y de dos columnas, tener diferentes tamaños de fuente para diferentes secciones, incluir imágenes con leyendas e incluso notas al pie. Compare esto con los conjuntos de datos en los que la mayoría de los documentos están organizados en oraciones, párrafos y capítulos con encabezados de sección: los tipos de documentos que suelen ser el foco de atención de la literatura clásica sobre procesamiento del lenguaje natural. largo entradas.
  • Diversas Plantillas: Un punto de referencia debe incluir diferentes diseños o plantillas estructurales. Es trivial para un modelo de alta capacidad extraer de una plantilla particular memorizando la estructura. Sin embargo, en la práctica, es necesario poder generalizar a nuevas plantillas/diseños, una capacidad que debe medir la división de prueba de entrenamiento en un punto de referencia.
  • OCR de alta calidad: Los documentos deben tener alta calidad Reconocimiento óptico de caracteres (OCR) resultados. Nuestro objetivo con este punto de referencia es centrarnos en la tarea VRDU en sí y excluir la variabilidad provocada por la elección del motor OCR.
  • Anotación a nivel de token: Los documentos deben contener anotaciones de verdad en el terreno que se puedan mapear al texto de entrada correspondiente, de modo que cada token se pueda anotar como parte de la entidad correspondiente. Esto contrasta con simplemente proporcionar el texto del valor que se extraerá para la entidad. Esto es clave para generar datos de entrenamiento limpios donde no tenemos que preocuparnos por coincidencias incidentales con el valor dado. Por ejemplo, en algunos recibos, el campo ‘total antes de impuestos’ puede tener el mismo valor que el campo ‘total’ si el monto del impuesto es cero. Tener anotaciones a nivel de token nos impide generar datos de entrenamiento en los que ambas instancias del valor coincidente se marcan como verdad básica para el campo ‘total’, lo que produce ejemplos ruidosos.

Conjuntos de datos y tareas de VRDU

El conjunto de datos VRDU es una combinación de dos conjuntos de datos disponibles públicamente, Formularios de registro y Formularios de compra de anuncios. Estos conjuntos de datos proporcionan ejemplos que son representativos de los casos de uso del mundo real y satisfacen los cinco requisitos de referencia descritos anteriormente.

El conjunto de datos de Ad-buy Forms consta de 641 documentos con detalles de anuncios políticos. Cada documento es una factura o recibo firmado por una estación de televisión y un grupo de campaña. Los documentos usan tablas, varias columnas y pares clave-valor para registrar la información del anuncio, como el nombre del producto, las fechas de transmisión, el precio total y la fecha y hora de publicación.

El conjunto de datos de formularios de registro consta de 1915 documentos con información sobre agentes extranjeros que se registran con el gobierno de EE. UU. Cada documento registra información esencial sobre agentes extranjeros involucrados en actividades que requieren divulgación pública. El contenido incluye el nombre del registrante, la dirección de las oficinas relacionadas, el propósito de las actividades y otros detalles.

Recolectamos una muestra aleatoria de documentos del público Comisión Federal de Comunicaciones (FCC) y Ley de Registro de Agentes Extranjeros (FARA) y convirtió las imágenes en texto usando Nube de Google LOC. Descartamos una pequeña cantidad de documentos que tenían varias páginas y el procesamiento no se completó en menos de dos minutos. Esto también nos permitió evitar el envío de documentos muy largos para la anotación manual, una tarea que puede llevar más de una hora para un solo documento. Luego, definimos el esquema y las instrucciones de etiquetado correspondientes para un equipo de anotadores con experiencia en tareas de etiquetado de documentos.

Los anotadores también recibieron algunos documentos etiquetados de muestra que nosotros mismos etiquetamos. La tarea requería anotadores para examinar cada documento, dibujar un cuadro delimitador alrededor de cada aparición de una entidad del esquema para cada documento y asociar ese cuadro delimitador con la entidad de destino. Después de la primera ronda de etiquetado, se asignó un grupo de expertos para revisar los resultados. Los resultados corregidos se incluyen en el conjunto de datos VRDU publicado. Por favor vea el papel para obtener más detalles sobre el protocolo de etiquetado y el esquema para cada conjunto de datos.

Puntos de referencia académicos existentes (FUNSD, CABLE, SROIE, Kleister-NDA, Kleister-Caridad, Forma profunda) se quedan cortos en uno o más de los cinco requisitos que identificamos para un buen punto de referencia de comprensión de documentos. VRDU los satisface a todos. Vea nuestro papel para obtener antecedentes sobre cada uno de estos conjuntos de datos y una discusión sobre cómo no cumplen con uno o más de los requisitos.

Construimos cuatro conjuntos de entrenamiento de modelos diferentes con 10, 50, 100 y 200 muestras respectivamente. Luego, evaluamos los conjuntos de datos de VRDU utilizando tres tareas (descritas a continuación): (1) aprendizaje de plantilla única, (2) aprendizaje de plantilla mixta y (3) aprendizaje de plantilla invisible. Para cada una de estas tareas, incluimos 300 documentos en el conjunto de prueba. Evaluamos modelos usando el Puntuación F1 en el conjunto de prueba.

  • Aprendizaje de plantilla única (STL): este es el escenario más simple donde los conjuntos de entrenamiento, prueba y validación solo contienen una sola plantilla. Esta sencilla tarea está diseñada para evaluar la capacidad de un modelo para manejar una plantilla fija. Naturalmente, esperamos puntuaciones F1 muy altas (0,90+) para esta tarea.
  • Aprendizaje de plantillas mixtas (MTL): esta tarea es similar a la tarea que utilizan la mayoría de los documentos relacionados: los conjuntos de capacitación, prueba y validación contienen documentos que pertenecen al mismo conjunto de plantillas. Tomamos muestras aleatorias de documentos de los conjuntos de datos y construimos las divisiones para asegurarnos de que la distribución de cada plantilla no cambie durante el muestreo.
  • Aprendizaje de plantillas invisibles (UTL): esta es la configuración más desafiante, donde evaluamos si el modelo puede generalizarse a plantillas invisibles. Por ejemplo, en el conjunto de datos de formularios de registro, entrenamos el modelo con dos de las tres plantillas y probamos el modelo con la restante. Los documentos de los conjuntos de capacitación, prueba y validación se extraen de conjuntos de plantillas inconexos. Hasta donde sabemos, los puntos de referencia y los conjuntos de datos anteriores no proporcionan explícitamente una tarea de este tipo diseñada para evaluar la capacidad del modelo para generalizar a plantillas que no se ven durante el entrenamiento.

El objetivo es poder evaluar modelos sobre su eficiencia de datos. En nuestro papel, comparamos dos modelos recientes usando las tareas STL, MTL y UTL e hicimos tres observaciones. Primero, a diferencia de otros puntos de referencia, VRDU es desafiante y muestra que los modelos tienen mucho espacio para mejoras. En segundo lugar, mostramos que el rendimiento de pocos disparos, incluso para los modelos más avanzados, es sorprendentemente bajo, e incluso los mejores modelos dan como resultado una puntuación de F1 inferior a 0,60. En tercer lugar, mostramos que los modelos luchan por lidiar con campos repetidos estructurados y se desempeñan particularmente mal en ellos.

Conclusión

Estrenamos lo nuevo Comprensión de documentos visualmente ricos (VRDU) conjunto de datos que ayuda a los investigadores a realizar un mejor seguimiento del progreso en las tareas de comprensión de documentos. Describimos por qué VRDU refleja mejor los desafíos prácticos en este dominio. También presentamos experimentos que muestran que las tareas de VRDU son desafiantes, y los modelos recientes tienen un margen sustancial para mejoras en comparación con los conjuntos de datos que se usan normalmente en la literatura, con puntajes F1 de 0.90 o más. Esperamos que el lanzamiento del conjunto de datos y el código de evaluación de VRDU ayude a los equipos de investigación a avanzar en la comprensión de documentos.

Agradecimientos

Muchas gracias a Zilong Wang, Yichao Zhou, Wei Wei y Chen-Yu Lee, coautores del artículo junto con Sandeep Tata. Gracias a Marc Najork, Riham Mansour y numerosos socios en Google Research y el equipo de Cloud AI por proporcionar información valiosa. Gracias a John Guiyard por crear las animaciones en esta publicación.

Leave a Reply

Your email address will not be published. Required fields are marked *