Datalab ha lanzado OmniExtractBench, un punto de referencia abierto para la extracción de documentos estructurados. Prueba con qué precisión un sistema completa un esquema JSON a partir de un PDF. El punto de referencia agrupa 620 documentos de 4 puntos de referencia existentes. Un evaluador determinista los califica a todos y explica cada decisión.
El lanzamiento llega mientras los proveedores de extracción publican sus propias tablas de clasificación. Datalab sostiene que esas tablas de clasificación son difíciles de comparar o auditar. OmniExtractBench es su intento de establecer un criterio compartido.
¿Es desplegable? Sí, el goleador se instala desde PyPI como omni-extract-bench (v0.1.7, Python 3.11+, solo SciPy) en Apache 2.0. Volver a ejecutar proveedores requiere sus propias claves API y créditos pagados.
OmniExtractBench es un punto de referencia de extracción estructurado creado por Datalab. Cada tarea le da a un sistema un PDF y un esquema JSON. El sistema devuelve JSON, que se puntúa valor por valor en un archivo Gold. El código está en GitHub y los datos están en Hugging Face bajo CC BY 4.0.
Los 4 defectos a los que apunta
La publicación de lanzamiento de Datalab menciona cuatro problemas recurrentes con los puntos de referencia de extracción existentes:
Sesgo: los documentos y la puntuación pueden favorecer al proveedor que creó el punto de referencia. Arneses opacos: una puntuación baja puede reflejar un arnés roto, no un modelo débil. Puntuación poco clara: los lectores no pueden decir por qué un documento determinado obtuvo una puntuación baja. Variedad de documentos limitada: algunas suites solo contienen tablas densas, otras solo archivos limpios y sin escanear.
De dónde proceden los 620 documentos
Los formularios de presentación reglamentaria son la categoría más grande, con 88 documentos. 128 documentos son una sola página. En el otro extremo, 33 documentos de más de 100 páginas ocupan el 40% del total de páginas. La propia suite sintética de Datalab ocupa el segundo lugar.
Cómo funciona el goleador
El anotador aplana la predicción y el JSON dorado en direcciones, que son caminos hacia valores únicos. Normaliza cada valor primero, por lo que “31/03/2024” coincide con “2024-03-31”.
Las mesas son la parte difícil. En comparación por posición, una fila omitida desplaza cada fila posterior. Volvimos a ejecutar el anotador en una tabla de 100 filas a la que le faltaba la primera fila. La comparación posicional obtuvo un 0%, mientras que OmniExtractBench obtuvo un 99%.
La solución es el emparejamiento basado en contenido con el algoritmo húngaro. ExtractBench y LongArray-Extract ya alinean filas de esta manera. OmniExtractBench agrega una capa de veredicto en la parte superior.
6 veredictos por valor
emparejado: emparejado y los valores concuerdan. mal leído: emparejado, pero los valores difieren. infundado: el oro tiene un valor, la predicción no. fabricado: el esquema lo permite, el oro calla, la predicción lo llena. elemento_inventado: parte de una fila prevista que no se empareja con nada. campo_inventado: una dirección que el esquema nunca declaró.
La precisión son valores coincidentes en todos los veredictos. La precisión divide los valores coincidentes entre los valores previstos. Recall los divide por los valores del oro. Las reglas completas están en las especificaciones métricas.
La regla nula
Las cadenas vacías, Ninguno y los espacios en blanco cuentan como omisiones, por lo que esas direcciones se eliminan. Cadenas como “NA” o “-” siguen siendo respuestas reales. Esto bloquea un exploit silencioso: rellenar un esquema con campos opcionales vacíos para obtener coincidencias gratuitas. En nuestra prueba, los campos nulos rellenos agregaron 0 veredictos.
Fuentes vinculadas al nombre de cada punto de referencia. Comprobado el 27 de septiembre de 2026.
Quien extraña campos y quien inventa valores
Datalab obtuvo 10 configuraciones de sistema en todo el corpus. Su modo preciso lideró con una precisión de 93,85. Datalab balanceado (93.48) y Reducto deep_extract v2 (93.47) están efectivamente empatados. La precisión y la recuperación muestran cómo falla cada sistema.
Equilibrado: Datalab (ambos modos) y Reducto mantienen la precisión y la recuperación dentro de 0,6 puntos. Se inclina hacia los fallos: GPT 5.6-sol registra una precisión de 95.11 pero una recuperación de 84.99. Pierde un 11,88% por valores infundados. Géminis y Claude muestran el mismo patrón, aunque de forma menos marcada. Se inclina por valores inventados: LlamaExtract tiene una recuperación de 93,13 pero una precisión de 86,57, perdiendo un 9,03% frente a valores inventados. Extend pierde un 4,01% por artículos inventados. Bajo en ambos: Mistral OCR 4.1 y Azure Content Understanding siguen el rastro en ambas métricas, con una recuperación aún más baja.
Cómo cada sistema no llega al 100%, por tipo de veredicto. Fuente: Laboratorio de datos.
Ejecútelo usted mismo
Instale el [benchmark] extra y ejecute oeb benchmark para volver a ejecutar proveedores. Las ejecuciones se pueden reanudar y cada proveedor necesita sus propias credenciales. Datalab también sugiere probar su campo de juego con sus propios documentos.
Conclusiones clave
OmniExtractBench agrupa 620 documentos de las suites LlamaIndex, micro1, Extend y Datalab. Un evaluador determinista otorga a cada valor 1 de 6 veredictos auditables. El emparejamiento de filas basado en contenido evita que una fila omitida ponga a cero una tabla. Eliminar direcciones nulas evita que el relleno del esquema infle las puntuaciones. Ventajas precisas de Datalab en 93,85; Datalab balanceado y Reducto empatado cerca de 93.5.
Preguntas frecuentes
¿Qué mide OmniExtractBench? Mide con qué precisión un sistema extrae valores de un PDF a un esquema JSON, puntuados por valor. ¿OmniExtractBench es de código abierto? Sí. El anotador es Apache 2.0 en GitHub y PyPI. El conjunto de datos es CC BY 4.0 en Hugging Face. ¿Quién construyó OmniExtractBench? Datalab lo construyó. Datalab también mantiene las herramientas de documentos de código abierto Marker y Surya.
Gracias al equipo de Datalab por los recursos detrás de este artículo. Datalab apoyó y patrocinó este contenido.
Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.