Este documento de IA presenta Tablerag: un marco de recuperación de texto y SQL híbrido para preguntas de múltiples saltos sobre documentos heterogéneos

Manejo de preguntas que involucran tanto el lenguaje natural como las tablas estructuradas se ha convertido en una tarea esencial para construir sistemas de IA más inteligentes y útiles. A menudo se espera que estos sistemas procesen contenido que incluye diversos tipos de datos, como texto mezclado con tablas numéricas, que se encuentran comúnmente en documentos comerciales, trabajos de investigación e informes públicos. Comprender dichos documentos requiere que la IA realice un razonamiento que abarca tanto las explicaciones textuales como los detalles basados en la tabla, un proceso que es inherentemente más complicado que la respuesta tradicional de preguntas basadas en texto.

Uno de los principales problemas en esta área es que los modelos de idiomas actuales a menudo no interpretan los documentos con precisión cuando las tablas están involucradas. Los modelos tienden a perder las relaciones entre filas y columnas cuando las tablas se aplanan en texto plano. Esto distorsiona la estructura subyacente de los datos y reduce la precisión de las respuestas, especialmente cuando la tarea involucra cálculos, agregaciones o razonamiento que conecta múltiples hechos en todo el documento. Dichas limitaciones hacen que sea difícil utilizar sistemas estándar para tareas prácticas de preguntas de preguntas múltiples que requieran información tanto de texto como de tablas.

Para resolver estos problemas, los métodos anteriores han intentado aplicar la generación de recuperación acuática (TRAPO) técnicas. Estos implican recuperar segmentos de texto y alimentarlos en un modelo de lenguaje para la generación de respuestas. Sin embargo, estas técnicas son insuficientes para tareas que requieren un razonamiento compositivo o global en grandes conjuntos de datos tabulares. Herramientas como Naiverag y TABLEGPT2 intentan simular este proceso convirtiendo las tablas en formato de Markdown o generando ejecución basada en código en Python. Sin embargo, estos métodos aún luchan con las tareas donde el mantenimiento de la estructura original de la tabla es necesaria para la interpretación correcta.

Investigadores de Huawei Cloud BU propusieron un método llamado Tablerag que aborda directamente estas limitaciones. La investigación introdujo Tablerag como un sistema híbrido que se alterna entre la recuperación de datos textuales y la ejecución estructurada basada en SQL. Este enfoque conserva el diseño tabular y trata las consultas basadas en la mesa como una unidad de razonamiento unificada. Este nuevo sistema no solo preserva la estructura de la tabla, sino que también ejecuta consultas de una manera que respeta la naturaleza relacional de los datos, organizada en filas y columnas. Los investigadores también crearon un conjunto de datos llamado HETOQA para comparar el rendimiento de su método en diferentes dominios y tareas de razonamiento de múltiples pasos.

Tablerag funciona en dos etapas principales. La etapa fuera de línea implica analizar documentos heterogéneos en bases de datos estructuradas extrayendo tablas y contenido textual por separado. Estos se almacenan en corpus paralelos, una base de datos relacional para tablas y una base de conocimiento fragmentado para texto. La fase en línea maneja las preguntas del usuario a través de un proceso iterativo de cuatro pasos: descomposición de consultas, recuperación de texto, programación y ejecución de SQL, y generación de respuestas intermedias. Cuando se recibe una pregunta, el sistema identifica si requiere un razonamiento tabular o textual, elige dinámicamente la estrategia apropiada y combina las salidas. SQL se utiliza para una ejecución simbólica precisa, lo que permite un mejor rendimiento en cálculos numéricos y lógicos.

Durante los experimentos, Tablerag se probó en varios puntos de referencia, incluidos Hybridqa, WikititableConsions y el recientemente construido HETOQA. Heteqa consta de 304 preguntas complejas en nueve dominios diversos e incluye 136 tablas únicas, así como más de 5,300 entidades derivadas de Wikipedia. El conjunto de datos desafía modelos con tareas como filtrado, agregación, agrupación, cálculo y clasificación. Tablerag superó todos los métodos de referencia, incluidos Naiverag, React y TableGPT2. Logró una precisión consistentemente mayor, con un razonamiento a nivel de documento impulsado por hasta 5 pasos iterativos, y utilizó modelos como Claude-3.5-Ennet y Qwen-2.5-72b para verificar los resultados.

El trabajo presentó una solución fuerte y bien estructurada al desafío de razonar sobre documentos de formato mixto. Al mantener la integridad estructural y la adopción de SQL para las operaciones de datos estructurados, los investigadores demostraron una alternativa efectiva a los sistemas basados en la recuperación existentes. TABLERAG representa un paso adelante significativo en los sistemas de pregunta y respuesta que manejan documentos que contienen tablas y texto, ofreciendo un método viable para una comprensión de documentos más precisa, escalable e interpretable.


Mira el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. ¿Listo para conectarse con más de 1 millón de desarrolladores/investigadores/investigadores de AI? Vea cómo Nvidia, LG AI Research y las principales compañías de IA aprovechan a MarktechPost para llegar a su público objetivo [Learn More]


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.