¡El! Me estaba dando respuestas bien y luego comenzó a alucinar. Todos lo hemos escuchado o experimentado.
Los modelos de generación de lenguaje natural a veces pueden alucinar, es decir, comienzan a generar texto que no es muy preciso para el aviso proporcionado. En términos laicos, comienzan inventando las cosas Eso no está estrictamente relacionado con el contexto dado o claramente inexacto. Algunas alucinaciones pueden ser comprensibles, por ejemplo, mencionar algo relacionado, pero no exactamente el tema en cuestión, otras veces puede parecer información legítima, pero simplemente no es correcto, está inventado.
Esto es claramente un problema cuando comenzamos a usar modelos generativos para completar tareas y tenemos la intención de consumir la información que generaron para tomar decisiones.
El problema no está necesariamente vinculado a cómo el modelo está generando el texto, sino en la información que está utilizando para generar una respuesta. Una vez que entrena una LLM, la información codificada en los datos de entrenamiento se cristaliza, se convierte en una representación estática de todo lo que el modelo conoce hasta ese momento. Para hacer que el modelo actualice su vista del mundo o su base de conocimiento, debe ser reentrenada. Sin embargo, la capacitación de modelos de idiomas grandes requiere tiempo y dinero.
Una de las principales motivaciones para desarrollar RAG es la creciente demanda de contenido de hecho, contextualmente relevante y actualizado.[1]
Al pensar en una forma de hacer que los modelos generativos sean conscientes de la riqueza de la nueva información que se crea todos los días, los investigadores comenzaron a explorar formas eficientes de mantener estos modelos al día que no requerían modelos de re-entrenamiento continuamente.
Se les ocurrió la idea para Modelos híbridoses decir, modelos generativos que tienen una forma de obtener información externa que puede complementar los datos que el LLM ya conoce y se capacitó. Estos modelos tienen un componente de recuperación de información que permite que el modelo acceda a datos actualizados y las capacidades generativas por las que ya son bien conocidas. El objetivo es garantizar tanto la fluidez como la corrección objetiva al producir texto.
Esta arquitectura de modelo híbrido se llama Recuperación de generación aumentada o trapo para abreviar.
La era del trapo
Dada la necesidad crítica de mantener los modelos actualizados de manera y rentable, RAG se ha convertido en una arquitectura cada vez más popular.
Su mecanismo de recuperación extrae información de fuentes externas que no están codificadas en el LLM. Por ejemplo, puedes ver a Rag en acción, en el mundo real, cuando le preguntas a Gemini algo sobre el puente Brooklyn. En la parte inferior verá las fuentes externas de las que extrajo información.
Al fundamentar la salida final de la información obtenida del módulo de recuperación, es menos probable que el resultado de estas aplicaciones de IA generativas propague cualquier sesgo que se origine desde la vista anticuada de los datos de capacitación que utilizaron.
La segunda pieza del Arquitectura de trapo es lo más visible para nosotros, los consumidores, el modelo de generación. Esto es típicamente un LLM que procesa la información recuperada y genera texto similar a los humanos.
RAG combina mecanismos de recuperación con modelos de lenguaje generativo para mejorar la precisión de las salidas[1]
En cuanto a su arquitectura interna, el módulo de recuperación se basa en vectores densos para identificar los documentos relevantes a usar, mientras que el modelo generativo utiliza la arquitectura LLM típica basada en transformadores.
Esta arquitectura aborda puntos de dolor muy importantes de modelos generativos, pero no es una bala de plata. También viene con algunos desafíos y limitaciones.
El módulo de recuperación puede lucha por obtener los documentos más actualizados.
Esta parte de la arquitectura depende en gran medida de la densa recuperación de pasos (DPR)[2, 3]. En comparación con otras técnicas como BM25, que se basa en TF-IDF, DPR hace un trabajo mucho mejor para encontrar la similitud semántica entre la consulta y los documentos. Aprovecha el significado semántico, en lugar de una simple coincidencia de palabras clave, es especialmente útil en aplicaciones de dominio abierto, es decir, piense en herramientas como Gemini o ChatGPT, que no son necesariamente expertos en un dominio particular, sino también saber Un poco sobre todo.
Sin embargo, DPR también tiene sus deficiencias. La densa representación vectorial puede conducir a documentos irrelevantes o fuera del tema que se recuperan. Los modelos DPR parecen recuperar información basada en el conocimiento que ya existe dentro de sus parámetros, es decir, los hechos ya deben estar codificados para ser accesible por recuperación[2].
[…] Si ampliamos nuestra definición de recuperación para abarcar la capacidad de navegar y dilucidar conceptos previamente desconocidos o no contados por el modelo, una capacidad similar a la forma en que los humanos investigan y recuperan información, nuestros hallazgos implican que los modelos DPR no alcanzan esta marca.[2]
Para mitigar estos desafíos, los investigadores pensaron en agregar expansión de consultas más sofisticada y desambiguación contextual. La expansión de la consulta es un conjunto de técnicas que modifican la consulta del usuario original al agregar términos relevantes, con el objetivo de establecer una conexión entre la intención de la consulta del usuario con documentos relevantes[4].
También hay casos en los que el El módulo generativo no tiene en cuenta completamente, en sus respuestas, la información recopilada en la fase de recuperación. Para abordar esto, ha habido nuevas mejoras sobre la atención y las técnicas jerárquicas de fusión [5].
El rendimiento del modelo es una métrica importante, especialmente cuando el objetivo de estas aplicaciones es ser parte sin problemas de nuestra vida cotidiana y hacer que las tareas más mundanas no tengan casi esfuerzo. Sin embargo, Ejecutar trapo de extremo a extremo puede ser computacionalmente costoso. Para cada consulta que hace el usuario, debe haber un paso para la recuperación de información y otro para la generación de texto. Aquí es donde nuevas técnicas, como la poda de modelos [6] y destilación del conocimiento [7] Entra en juego, para garantizar que incluso con el paso adicional de buscar información actualizada fuera de los datos del modelo capacitado, el sistema general todavía funciona.
Por último, mientras que el módulo de recuperación de información en la arquitectura de RAG está destinado a mitigar el sesgo al acceder a fuentes externas que están más actualizadas que los datos en los que se capacitó el modelo, en realidad puede no eliminar completamente el sesgo. Si las fuentes externas no se eligen meticulosamente, pueden continuar agregando sesgo o incluso amplificar los sesgos existentes de los datos de capacitación.
Conclusión
La utilización de RAG en aplicaciones generativas proporciona una mejora significativa en la capacidad del modelo para mantenerse al día y brinda a sus usuarios resultados más precisos.
Cuando se usa en aplicaciones específicas de dominio, su potencial es aún más claro. Con un alcance más estrecho y una biblioteca externa de documentos relacionados solo para un dominio en particular, estos modelos tienen la capacidad de hacer una recuperación más efectiva de nueva información.
Sin embargo, garantizar que los modelos generativos estén constantemente actualizados están lejos de ser un problema resuelto.
Los desafíos técnicos, como el manejo de datos no estructurados o la garantía de rendimiento del modelo, continúan siendo temas de investigación activos.
Espero que hayas disfrutado de aprender un poco más sobre el trapo, y el papel que desempeña este tipo de arquitectura para hacer que las aplicaciones generativas se mantengan actualizadas sin requerir volver a entrenar el modelo.
¡Gracias por leer!
- Una encuesta integral de la generación de recuperación aumentada (RAG): evolución, panorama actual y direcciones futuras. (2024). Shailja Gupta y Rajesh Ranjan y Surya Narayan Singh. (Arxiv)
- Generación de recuperación de recuperación: es una densa recuperación de la recuperación del pasaje. (2024). Benjamin Reichman y Larry Heck— (enlace)
- Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D. y Yih, WT (2020). Recuperación densa del pasaje para la respuesta de las preguntas de dominio abierto. En Actas de la Conferencia 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) (pp. 6769-6781).Arxiv)
- Hamin Koo y Minseon Kim y Sung Ju Hwang. (2024). Optimizando la generación de consultas para una recuperación mejorada de documentos en RAG. (Arxiv)
- Izacard, G. y Grave, E. (2021). Aprovechando la recuperación del pasaje con modelos generativos para la respuesta de preguntas de dominio abierto. En Actas de la 16ª Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional: Volumen principal (pp. 874-880). (Arxiv)
- Han, S., Pool, J., Tran, J. y Dally, WJ (2015). Aprender pesos y conexiones para una red neuronal eficiente. En avances en sistemas de procesamiento de información neural (pp. 1135-1143). (Arxiv)
- Sanh, V., debut, L., Chaumond, J. y Wolf, T. (2019). Distilbert, una versión destilada de Bert: más pequeña, más rápida, más barata y más ligera. Arxiv. /abs/1910.01108 (Arxiv)