En resumen: relevancia basada en proporciones para capturar la semántica de documentos de un extremo a otro |  de Antonio Alcaraz |  noviembre de 2023

Los métodos de búsqueda dominantes hoy en día normalmente se basan en la coincidencia de palabras clave o en la similitud del espacio vectorial para estimar la relevancia entre una consulta y los documentos. Sin embargo, estas técnicas tienen dificultades cuando se trata de buscar corpus utilizando archivos, artículos o incluso libros completos como consultas de búsqueda.

Un poco de diversión con Dall-E 3

Recuperación basada en palabras clave

Si bien las búsquedas de palabras clave son excelentes para búsquedas breves, no logran capturar la semántica crítica para el contenido de formato largo. Un documento que trata correctamente las “plataformas en la nube” puede pasar desapercibido en una consulta que busca experiencia en “AWS”. Las coincidencias exactas de términos enfrentan con frecuencia problemas de discrepancia de vocabulario en textos extensos.

Búsqueda de similitud vectorial

Los modelos modernos de incrustación de vectores como BERT condensaron el significado en cientos de dimensiones numéricas estimando con precisión la similitud semántica. Sin embargo, las arquitecturas de transformadores con atención propia no superan los 512-1024 tokens debido a la explosión de cálculo.

Sin la capacidad de asimilar documentos por completo, las incrustaciones parciales resultantes de “bolsas de palabras” pierden los matices de significado intercalados en las secciones. El contexto se pierde en la abstracción.

La prohibitiva complejidad informática también restringe el ajuste fino de la mayoría de los corpus del mundo real, lo que limita la precisión. El aprendizaje no supervisado ofrece una alternativa, pero faltan técnicas sólidas.

en un artículo reciente, los investigadores abordan exactamente estos problemas reimaginando la relevancia de consultas y documentos muy largos. Sus innovaciones desbloquean un nuevo potencial para la búsqueda de documentos mediante IA.

Los paradigmas de búsqueda dominantes hoy en día son ineficaces para consultas que contienen miles de palabras como texto de entrada. Los problemas clave que se enfrentan incluyen:

  • Transformadores como BERT tienen complejidad cuadrática de autoatención, lo que los hace inviables para secuencias más allá de 512-1024 tokens. Sus escasas alternativas de atención comprometen la precisión.
  • Modelos léxicos la coincidencia basada en superposiciones exactas de términos no puede inferir similitudes semánticas críticas para textos de formato largo.
  • La falta de datos de entrenamiento etiquetados para la mayoría de las colecciones de dominios requiere…