para construir un sistema de recuperación sobrediseñado. Se trataba de construir todo el sistema. Este se trata de hacer las evaluaciones.
En el artículo anterior, repasé diferentes partes de una canalización RAG: fragmentar los datos correctamente, optimizar las consultas, recuperar (semántica, BM25 o búsqueda híbrida), reclasificar, expandir los fragmentos a los vecinos, crear el contexto y luego generarlos con un LLM.
Una de las preguntas que recibí fue: ¿expandir fragmentos a los vecinos realmente mejora las respuestas, o simplemente agrega ruido y dificulta que el modelo se mantenga conectado?
Entonces eso es lo que probaremos aquí. Realizaremos algunas evaluaciones básicas y analizaremos métricas como fidelidad, relevancia de las respuestas, relevancia del contexto y tasa de alucinaciones, y compararemos resultados entre diferentes modelos y conjuntos de datos.
Ya he recopilado la mayoría de los resultados aquí y aquí, pero también los repasaremos.
Como nota, planeo comparar este tipo de canalización "avanzada" con una línea de base más ingenua más adelante. Pero este artículo trata principalmente sobre la evaluación del oleoducto tal como está.
Siempre reviso algunas secciones de introducción antes de profundizar, pero si eres nuevo, primero leo sobre cómo construir un sistema RAG básico, cómo funcionan las incrustaciones y una introducción real a las evaluaciones/métricas. Luego, también puedes leer cómo construir el pipeline sobredimensionado que presenté anteriormente, o al menos echarle un vistazo.
Si nada de esto es nuevo, pase a la parte de resultados.
Por qué realizamos evaluaciones
Las evaluaciones consisten en asegurarse de probar el sistema en un corpus más grande (más específico) que sus 10 preguntas favoritas, y asegurarse de que cualquier cambio que impulse no cambie la calidad del sistema.
Los cambios en los datos, las indicaciones o los modelos pueden afectar en gran medida el rendimiento sin que usted lo note.
Es posible que también deba mostrarle a su equipo el rendimiento general del sistema que ha creado antes de que se le permita probarlo en usuarios reales.
Pero antes de hacer esto, debes decidir qué probar.
¿Qué le parece un sistema exitoso? Si le interesan los saltos múltiples, necesita preguntas que realmente requieran saltos múltiples. Si le interesan las preguntas y respuestas y las citas adecuadas, pruebe eso. De lo contrario, terminarás evaluando algo equivocado.
Esto es un poco como hacer un trabajo de investigación: pruebas algo, intentas comprender los resultados y luego construyes mejores pruebas.
Para hacer esto bien, deberías intentar crear un conjunto dorado (a menudo a partir de registros de usuarios) para realizar pruebas.
Esto no siempre es posible, por lo que en situaciones como ésta construimos conjuntos de datos sintéticos. Puede que esta no sea la mejor manera de hacerlo, ya que claramente estará sesgada y no reflejará lo que realmente preguntarán los usuarios. Sin embargo, es posible que tengas que empezar por algún lado.
Para este artículo, he creado tres conjuntos de datos diferentes para que podamos discutirlo: uno creado a partir del corpus ingerido, uno que crea preguntas de usuario desordenadas a partir del corpus y otro con preguntas aleatorias sobre RAG que no se han generado a partir del corpus en absoluto.
Podrá ver cómo estos conjuntos de datos nos brindan diferentes resultados en las métricas, pero todos significan cosas diferentes.
Que pensar
No voy a repasar todo lo que hay que pensar aquí, porque hacer bien las evaluaciones es bastante difícil (aunque también divertido si te gustan las estadísticas y los datos).
Pero hay algunas cosas que debe tener en cuenta: los jueces de LLM son parciales, elegir preguntas es un problema, las respuestas de oro son mejores si las tiene y el uso de un conjunto de datos más grande con etiquetas le ayuda a desglosar dónde y cómo está fallando el sistema.
Si ha leído el artículo sobre métricas de evaluación, ya habrá visto la idea de un LLM como juez. Puede ser útil, pero no es intrínsecamente confiable porque tiene preferencias integradas y puntos ciegos.
Hay cosas que te volverán loco, como que un juez castigue una respuesta que se basa en el corpus pero que no se indica explícitamente en los fragmentos recuperados (resúmenes/pequeñas inferencias), o juzgar la misma respuesta de manera diferente dependiendo de cómo esté formulada la pregunta.
Te darás cuenta de esto más adelante, cuando profundices en las preguntas que no logran entender por qué.
Otra cosa a tener en cuenta es asegurarse de no seleccionar preguntas, incluso si siente la necesidad de hacerlo.
Obviamente tiene que comenzar por algún lado, pero el objetivo es acercarse a lo que sus usuarios realmente preguntan, encontrar los problemas y actualizar el conjunto de datos continuamente en función de lo que el sistema parece fallar. Es fácil obtener buenos números si prueba principalmente preguntas "fáciles", pero luego la evaluación se vuelve menos útil.
Lo mejor es tener no sólo preguntas de usuarios reales sino también respuestas de oro.
Entonces, incluso si puede "evitar" tener referencias utilizando un juez de LLM, lo mejor es tener las respuestas correctas para esas preguntas. Ahí es cuando puedes usar el LLM para juzgar si el resultado coincide con la respuesta de oro, en lugar de pedirle que juzgue la respuesta por sí solo.
El tamaño de la muestra también importa. Demasiado pequeño y puede que no sea confiable. Demasiado grande y es fácil pasar por alto problemas más pequeños.
Si tiene suficientes datos, puede etiquetar las preguntas en temas, diferentes redacciones (pesimista/frase típica) y diferentes tipos (corta/larga/desordenada) para que pueda ver qué se interrumpe y dónde.
He escuchado recomendaciones que comienzan con entre 200 y 1000 consultas reales con respuestas de oro si desea que esta sea una configuración de evaluación real.
Dado que todo este ejercicio es hipotético y el sistema ha ingerido documentos para demostrar la idea de expandirse a los vecinos, las evaluaciones tendrán conjuntos de datos generados sintéticamente y, por lo tanto, menos confiables, pero aún podemos aprender de ello.
Decidir sobre métricas y conjuntos de datos
Esta sección trata sobre dos cosas: qué métricas estoy usando para evaluar la canalización y cómo las uso en conjuntos de datos para ver si la expansión de vecinos parece ayudar.
Primero, si no ha leído nada sobre evaluaciones para sistemas LLM, lea este artículo. Le brinda una taxonomía de las diferentes métricas que existen (incluido RAG).
Como soy vago para esto, necesitaba métricas sin referencias, pero esto también nos limitará a lo que realmente podemos probar. Podemos hacer que el juez observe el contexto, la pregunta y la respuesta generada.
Algunas métricas que pueden ayudar aquí son la fidelidad (la respuesta se basa en el contexto proporcionado), la relevancia de la respuesta (realmente responde a la pregunta), la relevancia del contexto (cuánto del contexto es solo ruido) y la alucinación (cuántas afirmaciones están realmente respaldadas por el contexto proporcionado).
Dado que queremos determinar si la expansión de semillas es útil, y sin construir dos canales diferentes, podemos hacer una comparación simple: pedirle al juez que mire los trozos de semillas versus el contexto expandido final y califique qué parte de la respuesta proviene de cada uno para la métrica de fidelidad.
Si la conexión a tierra mejora cuando el juez ve el contexto ampliado, eso es al menos evidencia de que el modelo está utilizando los fragmentos ampliados y no es solo ruido. Sin embargo, necesitaríamos más pruebas para decir con seguridad cuál es el ganador.
Finalmente, los conjuntos de datos importan tanto como las métricas.
Si ha leído el primer artículo, sabrá que todos los documentos que se han ingerido son artículos científicos que mencionan RAG. Entonces, todas las preguntas que creemos aquí deben ser sobre RAG.
He generado tres conjuntos de datos diferentes con un sabor RAG diferente.
El primero se basa en el corpus ingerido, repasando cada artículo científico y escribiendo dos preguntas cada uno que pueda responder.
El segundo hace lo mismo pero proporciona preguntas confusas como: "¿Cómo mejora k2, por cierto, la búsqueda de respuestas en comparación con el trapo ingenuo, por ejemplo, cuáles son las puntuaciones de similitud en términos de q3?"
Este conjunto de datos desordenado de preguntas de usuarios podría ser bueno para probar el optimizador de consultas si lee el primer artículo (pero no tengo esos resultados aquí). Aquí nos dirá si decir las cosas de manera diferente sesgaría los resultados.
El tercer conjunto de datos se basa en 66 preguntas RAG aleatorias que se encuentran en línea. Esto significa que es posible que estas preguntas no tengan respuestas en el corpus (los artículos de RAG ingeridos son sólo de septiembre a octubre, por lo que no sabemos exactamente qué contienen).
Entonces los dos primeros evaluarán qué tan bien se comporta el oleoducto, si puede responder preguntas sobre los documentos que tiene, y el tercero nos dice qué le falta y cómo se comporta ante preguntas que quizás no pueda responder.
Aunque esto está un poco simplificado, ya que las primeras preguntas pueden estructurarse en secciones y las aleatorias pueden responderse mejor con trozos de semillas.
Ejecutando las evaluaciones
Para ejecutar las evaluaciones, primero debe ejecutar la canalización en cada pregunta, para cada modelo, y almacenar los resultados.
Si no almacena todo lo que necesita, no podrá depurar más adelante. Desea poder pasar de una puntuación baja a la respuesta exacta, el contexto recuperado exacto y la configuración exacta del modelo.
También quería comparar modelos, porque la gente supone que “modelo más grande = mejores respuestas”, y eso no siempre es cierto, especialmente para tareas más fáciles. Así que estoy ejecutando el mismo proceso en GPT-5-mini, GPT-5.1 y GPT-5.2 para varios conjuntos de datos.
Una vez hecho esto, construyo la capa de evaluación sobre esas salidas almacenadas.
Utilicé RAGAS para las métricas estándar y DeepEval para las personalizadas. Obviamente puedes construirlo manualmente, pero es mucho más fácil de esta manera. Me encanta lo fluido que es DeepEval, aunque es más difícil de depurar si encuentras problemas con el juez más adelante.
Algunos detalles: la tubería se ejecuta sin límite de contexto, el modelo de juez es gpt-4o-mini y usamos n=3 para RAGAS y n=1 para los jueces personalizados.
Dado que la expansión de vecinos es el objetivo de esta canalización, recuerde que también realizamos esta verificación: para verificar la fidelidad, calificamos la conexión a tierra con los fragmentos de semillas y con el contexto expandido completo, para ver si hay una diferencia.
Evaluación de resultados de conjuntos de datos y modelos.
Ejecutemos las evaluaciones de los diferentes conjuntos de datos, métricas y modelos para ver cómo funciona la canalización y cómo podemos interpretar los resultados. Recuerda que puedes encontrar los resultados completos aquí y aquí (especialmente si no te gustan mis bocetos infantiles).
Podemos comenzar con los resultados del conjunto de datos generado por el corpus.
La tabla anterior muestra las primeras métricas de RAGAS. La fidelidad (se mantiene basada en el contexto proporcionado) y la relevancia de la respuesta (responde a la pregunta) son muy altas.
Esto es de esperarse, ya que básicamente le estamos dando preguntas que debería poder responder con los documentos. Si estos mostraran números bajos, algo muy mal sucedería en el proceso.
También nos devuelve la fidelidad de las semillas, donde el juez estima qué tan fundamentada está la respuesta a los trozos de semillas. En general, este es mucho más bajo que la fidelidad del contexto completo, entre 12 y 18 puntos en los diferentes modelos.
En pocas palabras: podemos decir que el LLM utiliza parte del contexto completo, no solo los fragmentos iniciales, al generar su respuesta.
Sin embargo, lo que no podemos juzgar es si la respuesta de solo semilla habría sido igual de buena. Esto requerirá que ejecutemos dos canales y comparemos las mismas métricas y conjuntos de datos para cada uno.
Ahora veamos las siguientes métricas (para el mismo conjunto de datos).
Habría estimado que la relevancia del contexto disminuiría aquí, ya que al observar el contexto completo se obtienen hasta 10 fragmentos vecinos diferentes para la sección.
Una razón para esto puede ser que las preguntas generadas se basan en secciones, lo que significa que el contexto agregado ayuda a responderlas.
Las citas estructuradas (es decir, cita sus afirmaciones correctamente) parecen estar bien, pero la alucinación es alta, lo cual es bueno (1 significa que no hay afirmaciones inventadas en la respuesta).
Ahora verás que los distintos modelos aportan muy poca diferencia en cuanto a rendimiento.
Sí, esta es una tarea de preguntas y respuestas bastante sencilla. Pero sí demuestra que el tamaño adicional del modelo puede no ser necesario para todo, y la expansión del contexto adicional puede actuar como un amortiguador para los modelos más pequeños.
Ahora veamos los resultados si cambiamos el conjunto de datos a esas preguntas confusas de los usuarios.
Vemos algunas caídas en los puntos, pero aún se mantienen altos, aunque sin aislar los valores atípicos aquí no podemos decir por qué. Pero la fidelidad parece menor cuando solo se juzga con los trozos de semillas por las preguntas desordenadas de los usuarios, lo cual es interesante.
Pasemos ahora al tercer conjunto de datos, que podrá decirnos mucho más.
Vemos cifras peores por todas partes, lo cual, por supuesto, es de esperar; el corpus que se ha ingerido probablemente no pueda responder todas estas preguntas tan bien. Esto nos ayuda a señalar dónde nos falta información.
La fidelidad se mantiene alta, aunque aún se ejecuta durante todo el contexto. Aquí la diferencia con las ejecuciones de solo semilla es mucho mayor, lo que significa que la expansión agregada se usa más en la respuesta.
Algo extraño aquí fue cómo GPT-5.2 obtuvo consistentemente peores resultados en la relevancia de las respuestas en dos ejecuciones diferentes. Esto puede ser una cuestión métrica o puede ser un modelo en el que responde con más cautela que antes, obteniendo así una puntuación más baja.
Esto también le indica por qué es tan importante probar estos nuevos modelos en sus propias tuberías antes de agregarlos.
Continuaremos con las otras métricas para el conjunto de datos aleatorio.
La relevancia del contexto es muy baja, por lo que el juez cree que hay mucho ruido en el contexto que no responde directamente a la pregunta de este conjunto de datos.
La métrica de relevancia del contexto recompensa la recuperación de una alta proporción de fragmentos directamente relevantes, pero seed+expand agrega intencionalmente fragmentos vecinos (definiciones, secciones adyacentes, subtítulos) que deberían mejorar la conexión a tierra. Desafortunadamente, puede haber algo de ruido asociado a esto.
Tanto las citas estructurales como las alucinaciones obtienen peores resultados aquí, probablemente porque es más difícil mantenerse firme si no se le proporciona ninguna información relevante para usar.
Esta fue la primera construcción de este oleoducto. Según estos resultados, puede mejorarlo hasta aumentar esos números. Tal vez cambie las métricas para que sean más personalizadas para su canalización.
Ambos conjuntos de datos muestran cosas diferentes: el basado en corpus muestra el funcionamiento del oleoducto, el aleatorio muestra que falta información y que hay mucho más ruido por el que navegar.
que examinar
Entonces, ¿qué haces ahora que tienes todos estos puntajes? Puede observar las regresiones, los peores infractores y realizar un muestreo aleatorio.
Como dije antes, todo este ejercicio es un poco como un trabajo de investigación, que te encantará si te encanta trabajar con datos. Si tiene suficientes datos y los ha etiquetado, entonces divídalos y mire los números individuales y vea qué encuentra. Pero hay tres comprobaciones que siempre debes hacer.
Primero son las regresiones: verifique las cosas que solían pasar y ahora fallan después de los cambios.
El segundo es verificar a los peores infractores (entre 5 y 10 puntos de datos inferiores) para ver qué está sucediendo. Podría ser la métrica, el juez, podría ser la recuperación y podría ser el modelo.
A continuación se muestra uno de los peores en cuanto a total fidelidad y relevancia de las respuestas.
"question": "¿Con qué frecuencia la vinculación de entidades confunde acrónimos y nombres parecidos, y cómo pruebo eso?", "answer": "Los documentos no informan un número directo de "con qué frecuencia" la vinculación de entidades falla específicamente en acrónimos o nombres parecidos.nnLo que sí vemos es que:n- Incluso cuando la estructura es correcta, los LLM a menudo se vinculan a la propiedad o entidad incorrecta (inexactitudes semánticas) en la generación SPARQL en comparación con una académica kilos[2]. Este es el mismo modo de falla que verías cuando un acrónimo (por ejemplo, NMF, ACE) se asigna al nodo incorrecto.n- En los KG médicos, la vinculación de entidades se basa en palabras clave exactas y luego en la similitud semántica de las incrustaciones cuando no existe una coincidencia exacta.[3]. Este último paso permite explícitamente vincular a un concepto meramente "semánticamente relacionado" en lugar del concepto exacto, que es donde pueden ocurrir coincidencias y colisiones de acrónimos.[3].n- En los sistemas conversacionales centrados en entidades, la categoría de error más grande es la confusión de correferencia/entidad (27% de las fallas)[4], lo que muestra que confundir menciones similares es un problema práctico importante incluso fuera del estricto EL.nnCómo probar esto en su entorno, utilizando patrones de los artículos:n1) Cree un conjunto de pruebas específicasn – Cree un pequeño punto de referencia que enfatice acrónimos y entidades visual/léxicamente similares, de manera análoga a cómo se usa MATE para enfatizar la vinculación de entidades entre modos[1].n – Incluya pares positivos (acrónimo correcto→entidad) y negativos duros (diferentes entidades que comparten acrónimos o nombres casi idénticos).nn2) Ejecute su proceso EL completon – Utilice el mismo identificador/palabra clave/estrategia de vinculación basada en incrustaciones descrita en MedKGent[3].nn3) Evaluación manual y/o asistida por un LLMn: haga que humanos o un LLM califiquen si cada vínculo es correcto o incorrecto, similar a la rúbrica de triple validez utilizada en MedKGent[3]y la auditoría de errores SPARQL en FIRESPARQL[2].nn4) Analizar tipos de erroresn – Desglosar errores como el análisis semántico versus estructural en[2]y la tabla de errores en[4], pero con categorías "colisión de acrónimos", "forma de superficie similar", etc.nnEsto le dará una tasa de error empírico para su propia pila, centrada específicamente en acrónimos y similares.", "full_faithfulness": 0.24, "seed_faithfulness": 0.8260869565000001, "answer_relevancy": 0.0, "context_relevance": 0.208549739206933, "context_relevance_reason": "El contexto proporcionado no aborda directamente la pregunta del usuario sobre con qué frecuencia la vinculación de entidades confunde acrónimos y similares, ni ofrece métodos para probarlo. Si bien analiza la vinculación de entidades y su evolución, carece de información específica sobre las cuestiones relacionadas con las siglas y las imitaciones, que es el núcleo de la consulta del usuario.", "hallucination_score": 0.6572611409640697, "hallucination_reason": "La respuesta identifica con precisión que los documentos no proporcionan una frecuencia específica sobre la frecuencia con la que la vinculación de entidades falla con siglas o imitaciones, lo que se alinea con la consulta de entrada. También analiza cuestiones relevantes, como imprecisiones semánticas y confusión de correferencias, que son pertinentes para el tema. Sin embargo, carece de referencias directas a afirmaciones específicas hechas en el contexto, como las limitaciones de los métodos EL tradicionales o el papel de las palabras clave exactas en los KG médicos, lo que podría haber fortalecido aún más la respuesta.", "full_contexts": ["Entity LinkingnnEntity Linking (EL) ha evolucionado de métodos de solo texto a Multimodal Entity Linking (MEL) y, más recientemente, a Cross-Modal Entity Linking (CMEL), que admite el razonamiento intermodal. Los métodos tradicionales de EL asocian entidades textuales con sus entradas correspondientes en una base de conocimiento, pero pasan por alto la información no textual (Shen, Wang y Han 2015; Shen et al. 2023). MEL amplía EL incorporando información visual como atributos auxiliares para mejorar la alineación entre entidades y entradas de la base de conocimientos (Gan et al. 2021; Liu et al. 2024b; Song et al. 2024).", "Sin embargo, MEL no establece relaciones intermodales más allá de estas asociaciones auxiliares, lo que limita la interacción intermodal genuina", "CMEL va más allá al tratar el contenido visual como entidades (alineando entidades visuales con sus contrapartes textuales) para construir MMKG y facilitar explícitos. inferencia transmodal (Yao et al. 2023). La investigación sobre CMEL aún se encuentra en sus primeras etapas y carece de un marco teórico unificado y protocolos de evaluación sólidos. El punto de referencia MATE se introduce para evaluar el rendimiento de CMEL, pero sus escenas 3D sintéticas no logran capturar la complejidad y diversidad de las imágenes del mundo real (Alonso et al. 2025). Para cerrar esta brecha, construimos un conjunto de datos CMEL que presenta una mayor complejidad del mundo real y proponemos un método basado en agrupamiento espectral para la generación de entidades candidatas para impulsar mayores avances en la investigación de CMEL.", "3 Análisis de tipo de error en consultas SPARQL generadasnnA pesar de las mejoras de los LLM en control de calidad sobre los SKG, los LLM enfrentan limitaciones al manejar el análisis específico de KG. Los resultados experimentales realizados por Sören Auer et al.[2]demostró que ChatGPT solo podía responder 63 de 100 preguntas hechas a mano, de las cuales solo 14 respuestas eran correctas. Para comprender mejor por qué los LLM no generan la consulta SPARQL correcta para un NLQ, llevamos a cabo un experimento piloto sobre el uso de ChatGPT (GPT-4) con un ejemplo aleatorio de una sola vez para generar consultas SPARQL para 30 preguntas hechas a mano en los conjuntos de datos de referencia de SciQA". "Los conocimientos de este experimento piloto revelaron dos categorías principales de errores que los LLM tienden a cometer en esta tarea: imprecisiones semánticas e inconsistencias estructurales. Las imprecisiones semánticas ocurren cuando los LLM no logran vincular las propiedades y entidades correctas en ORKG, a pesar de generar consultas SPARQL con la estructura correcta. Nuestras observaciones revelan que los LLM tienden a confiar en el ejemplo proporcionado en el proceso de aprendizaje único para generar la estructura correcta para un cierto tipo de preguntas, pero a menudo tienen dificultades para vincular las propiedades y entidades correctas porque los LLM no aprenden el contenido del KG subyacente. Las inconsistencias estructurales surgen debido a la falta de esquema ontológico del KG subyacente por parte de los LLM, lo que genera errores en la estructura de la consulta, como enlaces faltantes o abundantes (triples), a pesar de vincularse correctamente a las entidades o propiedades mencionadas". "La Figura 1 muestra el ejemplo de imprecisiones semánticas e inconsistencias estructurales con las consultas SPARQL generadas en nuestro estudio piloto. En el ejemplo del problema de imprecisiones semánticas, ChatGPT no pudo vincular la propiedad correcta orkgp:P15687; en cambio, se vinculó a una propiedad incorrecta orkgp:P7101. En el ejemplo del problema de inconsistencias estructurales, la consulta SPARQL generada por ChatGPT vincula directamente la contribución con las métricas, no detecta el esquema correcto del ORKG donde la contribución y la métrica están conectadas a través de la evaluación.", "Fig. 1: Ejemplos de problemas de inexactitudes semánticas e inconsistencias estructurales con las consultas SPARQL generadasnnProblema de imprecisiones semánticasnnNo se pueden vincular las propiedades y entidades correctas en ORKGnn¿Cuál es el tamaño máximo de muestra?nnMétrica de evaluación de contribuciones P34 P2006 P7046nnProblema de inconsistencias estructuralesnnCometen errores en la estructura de la consulta, como enlaces faltantes o abundantes (triples)nn¿Cuáles son las métricas utilizadas por el documento "Uso de resumen de texto basado en NMFnnpara mejorar la clasificación supervisada y no supervisada?nnorkgp:P15687 rdfs:label Tamaño de muestra (n)nnorkgp:P7101 rdfs:label has elements", "2 Resultadosn2.1 Descripción general del métodoncomo su puntuación de confianza. Para Por ejemplo, si el triple (NPPA, correlación negativa, agua) aparece en el 90% de los resultados, su puntuación de confianza es 0,9. Las tripletas de baja confianza (puntuación <0,6) se filtran y solo se retienen las tripletas de alta confianza para la construcción del gráfico posterior. Cada tripleta también se anota con el ID de PubMed del resumen de origen y una marca de tiempo, lo que garantiza la trazabilidad y la atribución de la fuente. Negative Correlate, Water) tendría un ID de PubMed de 10494624 y una marca de tiempo de 2000-01-01.", "Como se muestra en la Figura 1 c, para cada triplete retenido, como (NPPA, Negative Correlate, Water), el Agente Constructor verifica su presencia en el KG actual. Si está ausente (es decir, faltan las entidades principal o final), si está presente, su puntaje de confianza se actualiza de acuerdo; a la ecuación (1) se agrega el ID de PubMed asociado y la marca de tiempo se actualiza para reflejar la última publicación. Por ejemplo, si un triple existente (NPPA, correlación negativa, agua) tiene una puntuación de confianza de 0,7, ID de PubMed 10691132 y marca de tiempo 1999-12-31, y una nueva aparición con una puntuación de confianza de 0,9, ID de PubMed 10494624. y se encuentra la marca de tiempo 2000-01-01, el triple actualizado tendrá una puntuación de confianza de 0,97, ID de PubMed [10691132, 10494624] y una marca de tiempo de 2000-01-01. Si las entidades principal y final están presentes pero la relación difiere, como existente (NPPA, Asociado, Agua) versus entrante (NPPA, Correlación Negativa, Agua), solo se mantiene la relación más apropiada. El Agente Constructor invoca al LLM para resolver el conflicto seleccionando la relación más adecuada, considerando las puntuaciones de confianza y las marcas de tiempo del triplete existente y entrante. Si el LLM selecciona el nuevo triple, el existente se reemplaza; de lo contrario, no se realizan cambios. la Sección 4.", "2.2 Caracterización estructural del gráfico de conocimientonnEn esta sección, detallamos las características estructurales del KG médico que construimos, con énfasis en la distribución de los tipos de nodos, los tipos de relación y las puntuaciones de confianza de los triples de relaciones. También presentamos una visualización de un subgráfico centrado en COVID-19 para ilustrar la estructura del gráfico.", "Usando el marco MedKGent, extrajimos los triples de conocimiento de los resúmenes de. 10.014.314 artículos médicos, con 3.472.524 resúmenes (34,68%) que arrojaron triples extraíbles. La tasa de extracción relativamente baja se puede atribuir a varios factores: en primer lugar, algunos resúmenes carecían de información estructurada suficiente para la extracción triple; caracteres, que fueron descartados, nuestro Agente Extractor identificó 8,922,152 tripletes válidos de los resúmenes. Sin embargo, los tripletes extraídos contenían un número significativo de duplicados y conflictos. Para resolver esto, nuestro Agente Constructor integra los tripletes en orden cronológico. Durante este proceso, los duplicados se fusionan, y la puntuación de confianza para cada triplete aumenta en proporción a su frecuencia, lo que refleja una mayor certeza. El agente conserva la relación más adecuada.
La relevancia de la respuesta fue castigada inusualmente baja por no poder responder la pregunta directa.
Sin embargo, este fue un caso atípico y, en general, la fidelidad total es mayor que la fidelidad de la semilla.
También puedes consultar uno bueno para entender cómo estima los que pasan.
"question": "¿Qué configuraciones de recuperación ayudan a reducir los problemas de "aguja en un pajar" para el control de calidad médico?", "answer": "Para reducir los problemas de "aguja en un pajar" en el control de calidad médico, la configuración de recuperación debe centrarse en recuperar un conjunto pequeño y muy específico de elementos altamente relevantes en lugar de un contexto grande y ruidoso.nn1. Controle el tamaño y la granularidad del contexton- Utilice resúmenes o fragmentos en lugar de artículos completos; largos y desenfocados El contexto diluyó el rendimiento del modelo en el control de calidad biomédico, por lo que fue necesario reclasificarlo a un subconjunto más pequeño y de alta calidad para obtener buenas respuestas.[1].n- Limite la cantidad de documentos pasados al modelo (p. ej., cambie la clasificación de miles a unos pocos cientos o menos) para evitar desorientar el modelo con demasiado texto.[1].nn2. Utilice la recuperación en varias etapasn: comience con la recuperación léxica de alta recuperación (p. ej., BM25 en PubMed) para obtener un conjunto amplio de candidatos (hasta miles).[1].n- Aplique un reclasificador semántico fuerte para seleccionar solo la porción superior para RAG (por ejemplo, los 300 principales)[1].n- Si faltan pruebas, recurra a una búsqueda web más amplia o de múltiples fuentes en sitios médicos confiables para llenar los vacíos, en lugar de sobrecargar la primera pasada con todo.[1].nn3. Mejore la calidad de las consultasn: utilice un LLM para reescribir o ampliar consultas (sinónimos, términos relacionados, jerga menos rara) cuando el recuerdo inicial sea deficiente, lo que aumenta las posibilidades de que se recupere el documento clave sin ampliar excesivamente cada consulta de forma predeterminada.[1].nn4. Utilice recuperación estructurada que tenga en cuenta el corpusn: recupere de fuentes de conocimiento médico estructuradas, como gráficos de conocimiento, y anteponga solo el subgráfico más relevante, lo que mejoró consistentemente la precisión en varios puntos de referencia de control de calidad médico.[3].n- En configuraciones multimodales/heterogéneas, utilice la recuperación específica de corpus para diferentes fuentes de conocimiento, de modo que cada corpus se busque con métodos adaptados a su contenido, en lugar de un recuperador genérico para todo.[2].", "full_faithfulness": 1.0, "seed_faithfulness": 0.8636363636000001, "answer_relevancy": 0.9135841092, "context_relevance": 0.8976322813389481, "context_relevance_reason": "Los pasajes de contexto proporcionan información completa sobre entornos de recuperación que pueden mitigar los problemas de la aguja en un pajar en el control de calidad médico. Específicamente, la discusión sobre la integración de LLM para la recuperación de información, el uso de reclasificación semántica y el enfoque de recuperación en múltiples etapas aborda directamente la pregunta del usuario. El énfasis en mantener la relevancia al tiempo que se amplía la cobertura de las consultas y la mención de los métodos conjuntos resaltan estrategias efectivas para mejorar la precisión de la recuperación en consultas biomédicas complejas. Sin embargo, si bien la información es muy relevante, una conexión más explícita con los desafíos específicos de 'una aguja en un pajar' podría mejorar la claridad.", "hallucination_score": 0.8893376167284271, "full_contexts": ["ResumennnLa respuesta a preguntas (QA) biomédicas plantea desafíos significativos debido a la necesidad de una interpretación precisa del conocimiento especializado extraído de un vasto, complejo y en rápida evolución. corpus. En este trabajo, exploramos cómo se pueden usar modelos de lenguaje grandes (LLM) para la recuperación de información (IR), y un conjunto de modelos de disparo cero puede lograr un rendimiento de vanguardia en una tarea de control de calidad Sí/No específica de un dominio. Al evaluar nuestro enfoque en las tareas de desafío de BioASQ, mostramos que los conjuntos pueden superar a los LLM individuales y, en algunos casos, rivalizar o superar los sistemas ajustados por dominio, todo ello preservando la generalización y evitando la necesidad de costosos ajustes o datos etiquetados. Nuestro método agrega resultados de múltiples variantes de LLM, incluidos modelos de Anthropic y Google, para sintetizar respuestas más precisas y sólidas. Además, nuestra investigación destaca una relación entre la duración del contexto y el desempeño: si bien los contextos ampliados están destinados a proporcionar evidencia valiosa, simultáneamente corren el riesgo de diluir la información y desorientar el modelo. Estos hallazgos enfatizan que la IR es una base fundamental en los enfoques de recuperación-generación aumentada (RAG) para sistemas de control de calidad biomédicos. La recuperación precisa y enfocada sigue siendo esencial para garantizar que los LLM operen dentro de los límites de la información relevante al generar respuestas a partir de los documentos recuperados. Nuestros resultados establecen que los enfoques de disparo cero basados en conjuntos, cuando se combinan con canales RAG efectivos, constituyen una alternativa práctica y escalable a los sistemas sintonizados por dominio para responder preguntas biomédicas.", "3. Nuestra metodologíann3.1. Canal de recuperación de informaciónnnPara admitir RAG de alta calidad para la Fase A+, desarrollamos un canal de IR que integra la búsqueda léxica tradicional con la generación de consultas basada en LLM y la reclasificación semántica (Fig. 1).", "Si la consulta inicial devuelve menos de cinco documentos, invocamos Gemini 2.5 Pro Preview (05-06) para revisar automáticamente la consulta. Se solicita al modelo que mejore la recuperación al permitir una coincidencia aproximada y omitiendo términos demasiado raros o específicos de un dominio. Este paso de refinamiento se realiza para mejorar la cobertura de la consulta manteniendo la relevancia. Nuestros experimentos han demostrado que este proceso es necesario en menos del 5% de las consultas en el conjunto de pruebas de BioASQ 13.", "Indizamos todos los títulos y resúmenes de artículos de PubMed en una instancia de Elasticsearch, utilizando la recuperación BM25 como función de clasificación. Para cada pregunta de entrada, utilizamos Gemini 2.0 Flash para generar una consulta estructurada de Elasticsearch que captura la intención semántica de la pregunta utilizando sinónimos, términos relacionados y reglas de sintaxis de cadenas de consulta booleanas completas compatibles con Elasticsearch. Esta consulta se valida mediante expresiones regulares y luego se utiliza para recuperar hasta 10 000 documentos.", "Después de la recuperación de documentos, aplicamos un modelo de reclasificación semántica (Google semantic-ranker-default004) para reducir la cantidad de documentos candidatos[11]. Este modelo vuelve a calificar los documentos recuperados inicialmente en función de la similitud semántica con la pregunta original, lo que nos permite seleccionar los 300 documentos más relevantes. Este subconjunto reclasificado se utiliza para el control de calidad basado en RAG, ya que a pesar de un contexto realmente extenso respaldado por las arquitecturas Transformer modernas [12, 13], no pudimos obtener resultados de control de calidad adecuados en resúmenes de artículos completos sin este paso". "Finalmente, hemos agregado búsquedas de IR adicionales para manejar los casos en los que un paso de control de calidad no arroja una respuesta basada en la evidencia recuperada de Elasticsearch. Hemos observado que el contexto de Elasticsearch podría no proporcionar evidencia suficiente para el control de calidad en entre el 3% y el 7% de los casos de prueba para la Fase A+, según el lote. Se utiliza un proceso automatizado para ampliar las fuentes de IR para abordar estos casos. Primero, utilizamos una búsqueda en Google restringida a fuentes de PubMed para intentar encontrar nuevas coincidencias. Si eso falla, ampliamos nuestras fuentes para incluir Home of the Office of Health Promotion and Disease Prevention, WebMD.nnEste enfoque de recuperación de varias etapas, que combina consultas generadas por LLM, una búsqueda tradicional de BM25 y una reclasificación semántica, permite una selección de documentos flexible, de alta precisión y de alta recuperación adaptada a consultas biomédicas complejas.", "Figura 1: proceso IRnnCorpus de PubMed en Elasticsearch Query Generation (Gemini) 2.0 Flash) Validación de consultas e IR (BM25, ≤ 10 000 documentos) Resultados < Refinamiento 2.5 Pro) Reclasificación (semantic-reranker-4) 300 artículos principales para RAG No Sí RefinarnnHealthline y Wikipedia. Esto garantiza que tengamos una respuesta candidata para todas las preguntas de los conjuntos de pruebas de la Fase A+.", "3.2. Canal de respuesta a preguntasnnAdoptamos un marco de control de calidad unificado y directo tanto para la Fase A+ como para la Fase B del desafío. Si bien el procedimiento básico de control de calidad sigue siendo consistente en todas las fases, la Fase A+ incorpora un paso de IR adicional para verificar la presencia de las respuestas de los candidatos dentro de los documentos relevantes (descritos al final de la Sección 3.1). Esto garantiza que los documentos seleccionados contengan suficiente información para respaldar la generación de respuestas.", "Para generar respuestas candidatas, aprovechamos varios modelos de lenguaje grandes (LLM): Gemini 2.0 Flash, Gemini 2.5 Flash Preview (2025-04-17) y Claude 3.7 Sonnet (2025-02-19). Las indicaciones se ajustan utilizando ejemplos derivados del conjunto de pruebas BioASQ 11, lo que mejora la estructura y la calidad de la respuesta.", "El sistema utiliza indicaciones de respuesta cero, adaptadas al tipo de pregunta: Sí/No, Factoide o Lista. Experimentamos con múltiples tipos de contexto de entrada: (1) resultados derivados de IR de la Fase A+, (2) fragmentos seleccionados proporcionados en la Fase B y (3) resúmenes completos de artículos seleccionados durante la Fase B. Esto nos permite examinar la influencia de la granularidad del contexto en la precisión y la integridad de las respuestas.", "Para consolidar las respuestas de los candidatos, realizamos un paso de síntesis secundario utilizando Gemini 2.0 Flash. Este modelo debe resolver cualquier contradicción, seleccionar los componentes de respuesta más precisos y específicos e integrar información complementaria en una respuesta única y unificada. Como parte de este paso, el modelo también devuelve una puntuación de confianza que estima la confiabilidad de la respuesta sintetizada. Si la puntuación está por debajo de un umbral predefinido (0,5, determinado empíricamente), la síntesis se vuelve a ejecutar con una temperatura de muestreo reducida (de 0,1 a 0,0) para mejorar el determinismo. Este proceso de síntesis se evalúa utilizando el conjunto de datos de BioASQ 12 para garantizar la coherencia con los estándares de referencia.", "Tabla 1nnResultados de nuestras ejecuciones en BioASQ 13 Fase A+, preguntas Sí/No.", "| | Lote | Sistema | Precisión | Clasificación |n|—:|:——–|:——————|———–:|———-:|n| 0 | 3 | Extractivo | 0,73 | 41 |n| 1 | | (último) | 0,23 | 58 |n| 2 | 4 | Extractivo | 0,92 | 1 |n| 3 | | Truncamiento simple | 0,88 | 11 |n| 4 | | Ksignifica | 0,65 | 67 |n| 5 | | (último) | 0,65 | 67 |nnTabla 2nnResultados de nuestras ejecuciones en BioASQ 13 Fase A+, preguntas factoides.", "| | Lote | Sistema | MRR | Clasificación |n|—:|:——–|:——————|——:|———-:|n| 0 | 3 | Extractivo | 0,14 | 41 |n| 1 | | (último) | 0,05 | 47 |n| 2 | 4 | Extractivo | 0,43 | 17 |n| 3 | | Truncamiento simple | 0,29 | 51 |n| 4 | | Ksignifica | 0,05 | 62 |n| 5 | | (último) | 0,05 | 62 |", "2 Trabajos relacionadosnnRecuperación de informes médicos para generación. Los enfoques médicos MMRAG existentes utilizan principalmente imágenes médicas para recuperar informes relevantes (He et al. 2024; Sun et al. 2025; Xia et al. 2024, 2025). Por ejemplo, FactMM-RAG (Sun et al. 2025) mejora la generación de informes incorporando informes de referencia de alta calidad. De manera similar, RULE (Xia et al. 2024) y MMed-RAG (Xia et al. 2025) integran informes de referencia y emplean ajustes de preferencias para mejorar la utilización del modelo de los informes recuperados. Aunque estos enfoques mejoran la precisión objetiva de las respuestas, descuidan la recuperación de documentos médicos, que son cruciales para la inferencia confiable de Med-LVLM.", "Medical Document Retrieval for Generation. Al reconocer las limitaciones de la recuperación únicamente de informes, estudios recientes han enfatizado cada vez más los documentos médicos como fuentes de conocimiento (Choi et al. 2025; Shaaban et al. 2025; Wu et al. 2025; Hamza et al. 2025). Entre ellos, MKGF (Wu et al. 2025) y K-LLaVA (Hamza et al. 2025) emplean recuperadores multimodales para recuperar documentos de la base de datos, con el objetivo de mitigar los problemas de alucinaciones en
Pero, francamente, aunque encuentro que la respuesta aún es un poco mediocre, no hay nada tan interesante en la respuesta. Pero esto apunta a problemas en el lado de la recuperación.
Por último, marque algunos al azar y vea cómo los evalúa.
"question": "cómo mido si obtengo fuentes diversas en lugar de 10 fragmentos del mismo pdf", "answer": "Puedes tratar u201cfuentes diversasu201d como algo que se mide directamente, no solo a simple vista.nn1. Puntuación simple de diversidad de fuentes (como en el documento)nEn el Documento 1, definen una métrica de diversidad de recuperación como la fracción de ID de revisión únicos entre los topu201110 fragmentos: Diversidad = (número de ID distintos) / 10[1].nPuedes copiar esta idea para los documentos:n- Asigna a cada PDF (o documento) una ID única.n- Cuando recuperas K fragmentos (por ejemplo, K=10), mira de qué documento proviene cada fragmento.n- Calcula: Diversidad = (número de ID de documentos distintos) / K.n u2022 Si los 10 fragmentos provienen del mismo PDF, Diversidad = 1/10 = 0,1 (muy baja).n u2022 Si los 10 fragmentos provienen de archivos PDF diferentes, Diversidad = 10 / 10 = 1,0 (diversidad perfecta).nnPuede registrar este número para cada consulta para controlar si está extrayendo repetidamente del mismo archivo o si realmente lo está distribuyendo por todo su corpus.nn2. Combine con relevancianEn el Documento 1, también rastrean qué tan cerca están los fragmentos de la consulta utilizando una similitud de coseno promedio entre la incrustación de la consulta y cada fragmento[1]. En la práctica, desea ambos:n- Alta similitud (sobre el tema).n- Alta diversidad (muchas identificaciones de fuentes diferentes).nn3. Opcional: una diversidad más rica más adelantenEl Documento 2 muestra que la diversidad también se puede medir en diferentes niveles (léxico, semántico, ingrediente) cuando se tienen múltiples resultados para una entrada[2]. Por analogía, una vez que esté satisfecho con la diversidad de fuentes, luego podría agregar:n- Diversidad semántica entre fragmentos (¿están diciendo cosas diferentes?).nPero el punto de partida más sencillo es la u2018identificaciones de documentos distintas/métrica Ku2019 por consulta.", "full_faithfulness": 0.8823529412000001, "seed_faithfulness": 0.5294117647000001, "answer_relevance": 0.8588673985, "context_relevance": 0.5303662744007874, "context_relevance_reason": "Los pasajes de contexto proporcionan información relevante sobre la medición de la diversidad en los sistemas de recuperación, particularmente en el contexto de la adaptación de recetas y los LLM. Sin embargo, si bien algunos pasajes analizan métricas de diversidad y métodos de recuperación, no abordan directamente la pregunta específica del usuario sobre la medición de diversas fuentes frente a múltiples fragmentos del mismo PDF. La relevancia del contexto es algo indirecta, lo que lleva a una puntuación moderada.", "hallucination_score": 0.7209711030557213, "hallucination_reason": "La respuesta describe efectivamente un método para medir la diversidad de fuentes al introducir una puntuación simple de diversidad de fuentes y proporcionar una fórmula clara. Se alinea bien con el contexto, que analiza las métricas de diversidad de recuperación. Sin embargo, si bien menciona la combinación de relevancia con diversidad, no conecta esto explícitamente con el enfoque del contexto en la similitud promedio del coseno, lo que podría mejorar la integridad de la respuesta. En general, las afirmaciones están respaldadas en su mayoría, con lagunas menores en las referencias directas al contexto." "full_context": ["D. Preguntas y respuestas (QA)nnPara recuperar reseñas, probamos cinco consultas centradas en Spotify y recuperamos los K = 10 fragmentos de reseñas principales para cada una. Medimos dos métricas no supervisadas:nnSimilitud de coseno promedio: la similitud de coseno promedio entre cada incrustación de consulta y sus 10 incrustaciones de fragmentos principales.", "Diversidad de recuperación: la fracción de ID de revisión únicos entre todos los fragmentos recuperados (ID distintos/10).nnNuestro recuperador logró una diversidad perfecta y puntuaciones de coseno de 0,618 a 0,754, lo que demuestra recuperación confiable y sobre el tema. La Tabla IX resume estas métricas proxy.", "Para la generación de respuestas, tomamos muestras aleatorias de 20 respuestas generadas (cada una emparejada con sus fragmentos citados) y las anotamos nosotros mismos, confirmando que cada respuesta (1) reflejaba los extractos citados, (2) cubría los puntos principales de esos extractos y (3) estaba escrita en una prosa clara y fácil de leer. Descubrimos que las respuestas eran precisas y completas.", "| | Consulta | Promedio Coseno Sim. | Diversidad |n|—:|:——————————————————————————-|——————-:|————:|n| 0 | ¿Qué quejas tienen los usuarios sobre | 0,713 | 1 |n| 1 | ¿Qué dicen los oyentes acerca de que Spotify falla o se congela al iniciar? | 0,754 | 1 |n| 2 | ¿Cómo describen los oyentes la experiencia de reproducción sin conexión de la aplicación? | 0,696 | 1 |n| 3 | ¿Cómo informan los usuarios errores o fallas al descargar canciones para usarlas sin conexión? | 0,618 | 1 |n| 4 | ¿Qué dicen los usuarios sobre la experiencia de transición de pistas y fundido cruzado de Spotify? | 0,65 | 1 |nnTABLA IX MÉTRICAS PROXY DE RECUPERACIÓN (K=10) PARA CONSULTAS SELECCIONADAS DE SPOTIFY (UNA MAYOR DIVERSIDAD ES MEJOR)", "2 Trabajo relacionadonnReceta de adaptación transcultural La adaptación transcultural de recetas (Cao et al., 2024) implica modificar recetas para adaptarlas a las preferencias dietéticas y estilos de escritura de la cultura de destino. Esto incluye no solo la traducción, sino también el ajuste de formatos, ingredientes y métodos de cocción para alinearlos con las normas culturales. Estudios anteriores (Cao et al., 2024; Pandey et al., 2025; Zhang et al., 2024) a menudo tratan la adaptación de recetas como una tarea de traducción intercultural, explorando cómo se pueden utilizar los LLM basados en indicaciones para la adaptación de recetas chino-inglés". "Sin embargo, la adaptación de recetas basada en LLM todavía enfrenta desafíos. Magomere et al. (2024) muestran que tales métodos pueden ser engañosos y reforzar los estereotipos regionales. Hu et al. (2024) identifican además dos desafíos principales: primero, los LLM carecen de conocimiento cultural culinario, lo que lleva a una adecuación cultural insuficiente. En segundo lugar, las recetas adaptadas tienen problemas de calidad, como cambiar ingredientes sin ajustar los pasos de cocción en consecuencia. Proponen otra forma de abordar estos problemas, concretamente a través de la recuperación de recetas interculturales, que obtiene recetas de prácticas culinarias reales dentro de la cultura de destino, y que generalmente ofrecen mejor calidad y alineación cultural. Sin embargo, en comparación con el uso directo de LLM, las recetas recuperadas a menudo tienen poca similitud con el original.", "Todos los estudios mencionados anteriormente se centran principalmente en la calidad de los resultados generados, incluida la idoneidad cultural y su preservación del original. Sin embargo, pasan por alto la diversidad de los resultados y no exploran el uso de RAG para la adaptación de recetas transculturales. Nuestro estudio enfatiza la compensación entre diversidad y calidad, con un enfoque particular en los enfoques basados en RAG.", "Diversidad en la generación de texto, IR y RAG Estudios anteriores (Lanchantin et al., 2025) han demostrado que los LLM posteriores a la capacitación tienden a afinar su distribución de probabilidad de salida, lo que lleva a una diversidad de respuestas reducida. Esto ha generado una preocupación común sobre la insuficiente diversidad de los LLM, particularmente en tareas creativas. Se utilizan ampliamente varios métodos de decodificación basados en muestreo estocástico para controlar el nivel de diversidad, en particular ajustando hiperparámetros como la temperatura (Shi et al., 2024). Sin embargo, estos métodos a menudo todavía no logran lograr una diversidad suficiente y pueden conducir a una rápida disminución en la calidad de la producción, que es otro factor importante a considerar al medir la diversidad (Lanchantin et al., 2025).", "Figura 2: Descripción general de CARRIAGE. Se destacan los componentes de diversidad. Primero mejoramos la diversidad de los resultados recuperados, luego habilitamos un uso más diverso de la información contextual a través de la selección dinámica del contexto e inyectamos contexto contrastivo para evitar que el LLM genere resultados similares a las recetas generadas previamente.nnRecuperación de múltiples consultas Cultura de origen Receta Cultura objetivo Reclasificación consciente de la diversidad Reescritura de consultas Contexto dinámico Organización Grupo de recetas generadas previamente Generación de LLM Inyección de contexto contrastante Anteriormente: Componente de diversidad Recetas de referencia Selección Relevancia DiversidadnnPuede generar múltiples vecesnnEn IR, la recuperación de texto con alta diversidad puede cubrir una gama más amplia de subtemas, acomodando así las preferencias potencialmente diversas de diferentes usuarios. Métodos como la reescritura de consultas diversas (Mohankumar et al., 2021) y la reclasificación teniendo en cuenta la diversidad (Carbonell y Goldstein, 1998; Krestel y Fankhauser, 2012) pueden mejorar eficazmente la diversidad de los resultados de recuperación. Algunos trabajos recientes (Carraro y Bridge, 2024) han explorado el uso de LLM para mejorar la diversidad en la reclasificación.", "En RAG, los trabajos anteriores se han centrado principalmente en recuperar resultados diversos para obtener información más completa, como mitigar las limitaciones de la ventana de contexto (Wang et al., 2025) y abordar tareas de respuesta a preguntas de múltiples saltos (Rezaei y Dieng, 2025). Estos trabajos se enmarcan principalmente como respuesta a preguntas, con el objetivo de adquirir conocimientos integrales para producir una única respuesta correcta. En consecuencia, las métricas de evaluación enfatizan la precisión de las respuestas más que la diversidad. Por el contrario, nuestra tarea permite naturalmente múltiples respuestas válidas. Por lo tanto, adoptamos diferentes estrategias para fomentar la diversidad de respuestas y utilizamos métricas que evalúan explícitamente la diversidad de los resultados finales. Si bien trabajos anteriores se han centrado en gran medida en recuperar contextos diversos, nuestro enfoque va un paso más allá al investigar cómo utilizar contextos tan diversos para producir resultados diversos.", "5 métricasnnNuestras métricas de evaluación se centran en dos aspectos clave: diversidad y calidad. Para evaluar la diversidad, consideramos factores como la diversidad léxica, semántica y de ingredientes desde una perspectiva por entrada. Como compensación, evaluamos la calidad desde dos dimensiones: la preservación de la receta de origen y la idoneidad cultural para los usuarios en la cultura de destino.", "5.1 DiversidadnnKirk et al. (2023) han propuesto dos paradigmas para medir la diversidad: entre entradas (sobre pares de una entrada y una salida) y por entrada (una entrada, varias salidas). La diversidad por insumo nos ayuda a investigar si una sola receta se puede adaptar en múltiples variantes para satisfacer diferentes preferencias dietéticas, mientras que la diversidad entre insumos evalúa si las recetas generadas exhiben colectivamente una gama diversa de patrones lingüísticos. Debido a que nuestra investigación se centra principalmente en si una receta única se puede adaptar en diversas variaciones para satisfacer una gama más amplia de necesidades, adoptamos la configuración de diversidad por entrada como nuestro principal enfoque experimental. La configuración de diversidad entre entradas se analiza con más detalle en la Sección 7.", "Para una métrica de diversidad D, bajo la configuración del modelo c, A denota un conjunto de recetas adaptadas", "que contiene N recetas fuente, definimos A ic = { aic, 1, aic, 2,. . . , aic,K } como el conjunto de K adaptaciones para la i-ésima receta fuente en la configuración c. La diversidad por entrada se define de la siguiente manera:nnDiversidad léxica La diversidad léxica es una medida de la variedad de vocabulario utilizado dentro de un conjunto de texto. Una alta diversidad léxica indica el uso de una amplia gama de palabras únicas, que pueden corresponder a una variedad más amplia de ingredientes, métodos de cocción y sabores. Empleamos Unique-n (Johnson, 1944) para evaluar la diversidad léxica, calculada como la proporción de n -gramas únicos con respecto al número total de n -gramas.
Al evaluar este elemento anterior con otro LLM, dijo que pensaba que el comentario de relevancia del contexto era un poco quejoso.
Pero como puede ver, las puntuaciones bajas no tienen por qué significar que el sistema sea malo. Hay que examinar por qué son bajos y también por qué son altos para entender cómo trabaja el juez o por qué está fallando el oleoducto.
Un buen ejemplo es la relevancia del contexto aquí. La relevancia del contexto mide qué parte del contexto recuperado fue útil. Si está haciendo una expansión de vecinos, casi siempre incluirá texto irrelevante, por lo que la precisión del contexto se verá peor, especialmente si el corpus no puede responder la pregunta en primer lugar.
La pregunta es si el contexto adicional realmente ayuda a la conexión a tierra (tasa de fidelidad/alucinaciones) lo suficiente como para que valga la pena el ruido.
Algunas notas cautelosas
Bien, algunas notas antes de terminar con esto.
Probar semillas aquí está claramente sesgado y no nos dice si realmente fueron útiles por sí solas. Tendríamos que construir dos tuberías diferentes y compararlas una al lado de la otra para decirlo correctamente.
Intentaré hacer esto en el futuro, con este caso de uso exacto.
También debo señalar que el sistema tiene muy pocos documentos en proceso: sólo unos 150 archivos PDF junto con algunos archivos de Excel, que son unos pocos miles de páginas. Pero tengo que demostrar esto en público, y esta era la única manera.
Recuerde que aquí solo usamos métricas del lado de la generación, observando el contexto que se recuperó. Si el contexto recuperado miente o tiene información contradictoria, es posible que estas métricas no lo muestren, hay que medir eso antes.
Además, muchos equipos también crean sus propias métricas personalizadas, que son exclusivas de su proceso y de lo que quieren probar, e incluso si comienza así, con las generales, puede detectar lo que necesita a lo largo de la línea para crear otras más específicas.
Lo último a tener en cuenta es el sesgo de los jueces de LLM. Estoy usando modelos OpenAI tanto para el proceso RAG como para el evaluador. Por lo general, esto no se recomienda, pero siempre que los modelos sean diferentes del generador y se juzgue, generalmente se acepta.
Con suerte, fue una lectura divertida (si eres un idiota con los datos como yo).
Estén atentos al último artículo donde intento probar un canal más ingenuo con este (espero tener tiempo para terminarlo).
Si quieres mantenerte actualizado o simplemente conectarte, me encontrarás en LinkedIn, mi sitio web o Medium (y aquí también).
❤