Los LLM han demostrado un fuerte rendimiento de propósito general en varias tareas, incluido el razonamiento matemático y la automatización. Sin embargo, luchan en aplicaciones específicas de dominio donde el conocimiento especializado y el razonamiento matizado son esenciales. Estos desafíos surgen principalmente de la dificultad de representar con precisión el conocimiento del dominio de la cola larga dentro de los presupuestos de parámetros finitos, lo que lleva a alucinaciones y a la falta de habilidades de razonamiento específicas de dominio. Los enfoques convencionales para la adaptación del dominio, como el ajuste o el pretrenesa continuo, a menudo dan como resultado un conocimiento imposible de rastrear y mayores costos de capacitación. Aunque útil para complementar el conocimiento, TRAPO Los métodos generalmente se quedan cortos en los modelos de enseñanza cómo razonar con esa información. Un desafío de investigación clave es cómo separar el aprendizaje del conocimiento del dominio del razonamiento, lo que permite que los modelos prioricen el desarrollo de habilidades cognitivas bajo recursos limitados.
Dibujando paralelos de la teoría de la educación, particularmente la taxonomía de Bloom, queda claro que construir habilidades de razonamiento avanzado requiere algo más que la memorización del conocimiento. Las habilidades cognitivas de orden superior, como el análisis, la evaluación y la síntesis, a menudo se obstaculizan cuando los modelos están cargados de memorizar hechos de dominio extensos. Esta observación plantea la cuestión de si las capacidades de razonamiento pueden mejorarse independientemente de la internalización del conocimiento a gran escala. En la práctica, muchos métodos existentes se centran en gran medida en almacenar el conocimiento dentro de los parámetros del modelo, complicando actualizaciones y aumentando el riesgo de resultados obsoletos o incorrectos. Incluso las técnicas basadas en la recuperación tratan documentos recuperados como entradas en lugar de herramientas para aprender procesos de razonamiento. El futuro de la inteligencia específica del dominio puede depender de los enfoques que reducen la dependencia de la memorización interna y, en su lugar, utilicen fuentes de conocimiento externas como andamios para el desarrollo de habilidades de razonamiento, lo que permite a los modelos más pequeños resolver tareas complejas de manera más eficiente.
Investigadores de la Universidad de Pekín, la Universidad de Shanghai Jiao Tong, la Universidad del Northeastern, la Universidad de Nankai, el Instituto de Investigación de Algoritmos Avanzados (Shanghai), Tecnología de OriginHub, Memtensor y el Laboratorio de Inteligencia Artificial de Shanghai han introducido un nuevo paradigma llamado Modelado de razonamiento de recuperación (raro). Inspirado en la taxonomía de Bloom, raro separa el almacenamiento de conocimiento del razonamiento mediante el uso de bases de datos externos para el conocimiento del dominio, mientras que los modelos de capacitación se centran en la justificación contextual. Esto permite que los modelos omitan el aprendizaje fáctico pesado de memoria y prioricen el desarrollo de habilidades cognitivas. Los experimentos muestran que los modelos livianos capacitados raros superan a los modelos más grandes como GPT-4 en puntos de referencia, que ofrecen un enfoque escalable y eficiente para la inteligencia específica del dominio.
Un marco propuesto cambia el enfoque de memorizar el conocimiento del dominio al desarrollo de habilidades de razonamiento. Al combinar el conocimiento externo recuperado con el razonamiento paso a paso, los modelos generan respuestas basadas en la comprensión y la aplicación en lugar de el recuerdo. El marco modela las respuestas como una secuencia de tokens de conocimiento y razonamiento, optimizando para integrar información recuperada e inferencia contextual. Utilizando modelos expertos para la destilación del conocimiento, construye datos de capacitación de alta calidad y emplea un refinamiento adaptativo para la corrección. En base a teorías cognitivas como el aprendizaje contextual, este enfoque permite que los modelos livianos logren un rendimiento fuerte específico del dominio a través del ajuste fino y el entrenamiento centrado en el razonamiento.
El estudio evalúa la efectividad del marco raro utilizando cinco conjuntos de datos de control de calidad centrados en la salud que requieren razonamiento de múltiples saltos. Se probaron modelos livianos como Llama-3.1-8b, Qwen-2.5-7b y Mistral-7B contra líneas de base COT, SFT y RAG. Los resultados muestran que raro supera constantemente estas líneas de base en todas las tareas, con un diagnóstico médico notable y ganancias de razonamiento científico. En comparación con Deepseek-R1-Distill-Llama-8B y GPT-4, los modelos capacitados raros lograron una mayor precisión, excediendo GPT-4 en más del 20% en algunas tareas. Estos hallazgos destacan que los modelos de entrenamiento para el razonamiento específico de dominio a través del aprendizaje contextual estructurado es más efectivo que simplemente aumentar el tamaño del modelo o depender únicamente de la recuperación.
En conclusión, el estudio presenta raro, un nuevo marco que mejora el razonamiento específico del dominio en LLM al separar el almacenamiento de conocimiento del desarrollo del razonamiento. Basándose de la taxonomía de Bloom, RARE evita la memorización de parámetros al recuperar el conocimiento externo durante la inferencia e integrarlo en las indicaciones de capacitación, fomentando el razonamiento contextual. Este cambio permite que los modelos livianos superen a los más grandes como GPT-4 en tareas médicas, logrando una precisión de hasta un 20% mayor. Rara promueve un enfoque escalable para la inteligencia específica del dominio mediante la combinación de bases de conocimiento mantenibles con modelos eficientes centrados en el razonamiento. El trabajo futuro explorará el aprendizaje de refuerzo, la curación de datos y las aplicaciones en tareas multimodales y de dominio abierto.
Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.
Sana Hassan, una pasante de consultoría en MarktechPost y estudiante de doble grado en IIT Madras, le apasiona aplicar tecnología e IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.