Conocer la investigación: un nuevo marco de IA que capacita a LLMS para razonar con la búsqueda a través del aprendizaje de refuerzo sin usar datos supervisados ​​sobre pasos de razonamiento

Los modelos de idiomas grandes (LLM) han demostrado un progreso significativo en varias tareas, particularmente en las capacidades de razonamiento. Sin embargo, la integración efectiva de los procesos de razonamiento con operaciones de búsqueda externas sigue siendo un desafío, especialmente para las preguntas de múltiples saltos que requieren intrincadas cadenas de razonamiento y múltiples pasos de recuperación. Los métodos actuales dependen principalmente de indicaciones o heurísticas diseñadas manualmente, lo que plantea limitaciones en la escalabilidad y la flexibilidad. Además, la generación de datos supervisados ​​para escenarios de razonamiento de varios pasos a menudo es prohibitivamente costoso y prácticamente inviable.

Investigadores de Baichuan Inc., la Universidad de Tongji, la Universidad de Edimburgo y la Universidad de Zhejiang presentan investigación, un nuevo marco de IA diseñado para capacitar a LLM para integrar el razonamiento con la búsqueda a través del aprendizaje de refuerzo, especialmente sin confiar en los pasos de razonamiento supervisados. La metodología central de investigación incorpora operaciones de búsqueda directamente en la cadena de razonamiento. Utilizando la optimización de políticas relativas del grupo (GRPO), una técnica de aprendizaje de refuerzo, la investigación guía a LLM para identificar de forma autónoma momentos y estrategias óptimas para realizar operaciones de búsqueda, que posteriormente influyen en el razonamiento continuo. Este enfoque permite a los modelos refinar progresivamente su razonamiento y facilitar naturalmente capacidades avanzadas, como la reflexión y la autocorrección.

Desde una perspectiva técnica, la investigación emplea formatos de producción estructurados al incorporar etiquetas específicas, como <think>, <search>, <result>y <answer>—Da la cadena de razonamiento. Estas etiquetas facilitan una comunicación clara entre el modelo y el entorno de recuperación externo, organizando sistemáticamente las salidas generadas. Durante la capacitación, la investigación excluye intencionalmente los resultados de la recuperación de los cálculos de pérdidas para prevenir el sesgo modelo. Las señales de recompensa que guían el proceso de aprendizaje de refuerzo se basan en criterios sencillos: evaluación de precisión a través de las puntuaciones de F1 y la adherencia al formato de salida estructurado predefinido. Este diseño fomenta el desarrollo autónomo de patrones de razonamiento sofisticados, eludiendo la necesidad de conjuntos de datos de razonamiento anotados manualmente.

La evaluación experimental confirma la robustez de la investigación. Cuando se evalúa en puntos de referencia de preguntas de respuesta múltiple, incluidos Hotpotqa, 2wikimultihopqa, Musique y Bamboogle, la investigación superó constantemente los métodos de referencia. Específicamente, la investigación de investigación-QWEN-32B logró mejoras que varían entre 8.9% y 22.4% en rendimiento en comparación con las líneas de base establecidas. En particular, estos avances se lograron a pesar de que el modelo fue entrenado exclusivamente en un solo conjunto de datos, subrayando sus fuertes capacidades de generalización. Otros análisis demostraron que los modelos aumentaron gradualmente su dependencia de las operaciones de búsqueda iterativa durante la capacitación, lo que indica una mayor competencia de razonamiento. Un estudio de caso detallado ilustró la capacidad del modelo para identificar consultas de búsqueda subóptimas, reflexionar sobre sus pasos de razonamiento e implementar acciones correctivas de forma autónoma.

En resumen, la investigación presenta un avance metodológico significativo en la capacitación de LLM para integrar sin problemas el razonamiento con mecanismos de búsqueda externos a través del aprendizaje de refuerzo. Al eliminar la dependencia de los datos de razonamiento supervisados, este marco aborda efectivamente la escalabilidad crítica y los problemas de adaptabilidad inherentes a los escenarios de razonamiento de múltiples saltos. Su capacidad para la autorreflexión y la corrección mejora su aplicabilidad práctica en contextos complejos y realistas. Las instrucciones de investigación futuras pueden extender aún más este marco basado en el aprendizaje de refuerzo a aplicaciones más amplias e incorporar recursos de conocimiento externos adicionales.


Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.