Los modelos de idiomas grandes (LLM) han avanzado significativamente en el procesamiento del lenguaje natural, pero el razonamiento sigue siendo un desafío persistente. Mientras que tareas como la resolución de problemas matemáticos y la generación de código se benefician de los datos de capacitación estructurados, tareas de razonamiento más amplias, como la deducción lógica, la inferencia científica y el razonamiento simbólico, a partir de datos dispersos y fragmentados. Los enfoques tradicionales, como el pretrenesa continua en el código, a menudo incrustan las señales de razonamiento implícitamente, lo que dificulta que los modelos se generalicen. Incluso los métodos de generación de texto a código siguen siendo limitados por el aprendizaje específico de sintaxis, lo que limita su aplicabilidad más allá de las tareas relacionadas con la programación. Se necesita un enfoque más estructurado para exponer LLM a patrones de razonamiento fundamentales al tiempo que preserva el rigor lógico.
Deepseek AI Research presenta Codei/oun enfoque que convierte el razonamiento basado en el código en lenguaje natural. Transformando el código sin procesar en un formato de predicción de entrada-salida y expresando pasos de razonamiento a través de Cadena de pensamiento (cot)Codei/o permite a los LLM internalizar procesos de razonamiento básicos como Planificación del flujo lógico, transversal del árbol de decisión y descomposición modular. A diferencia de los métodos convencionales, Codei/o separa el razonamiento de la sintaxis del código, lo que permite una aplicabilidad más amplia mientras mantiene la estructura lógica.
Descripción técnica y beneficios
Codei/o sigue una tubería de procesamiento de datos estructurado:
- Recopilación de archivos de código sin procesar: Se reunieron más de 450k funciones de múltiples fuentes, incluidos repositorios de algoritmos y conjuntos de datos de programación educativa.
- Estandarización de los datos: El código recopilado se refinó utilizando Deepseek-V2.5, asegurando la claridad y la compatibilidad de la ejecución.
- Generación de pares de entrada-salida: Las funciones se ejecutaron con entradas variables para crear ejemplos de capacitación estructurados en diversas tareas de razonamiento.
- Generar razonamiento de la cadena de pensamiento: Utilizando modelos como Deepseek-V2.5, se generaron explicaciones del lenguaje natural para proporcionar un razonamiento estructurado.
- Verificación y refinamiento: Las predicciones se validaron a través de la ejecución, con respuestas incorrectas revisadas de manera iterativamente para mejorar la precisión del razonamiento.
Características clave de Codei/O:
- Aprendizaje transformador: Convierte diversos patrones de código en Lenguaje natural Cot Presentacioneshaciendo que el razonamiento sea transferible más allá de los contextos de programación.
- Aprendizaje de sintaxis: aprendizaje: Separa el razonamiento lógico de sintaxis del códigoMejora de la adaptabilidad en las tareas de razonamiento.
- Mejora de tareas múltiples: Mejora el rendimiento a través de dominios de razonamiento simbólico, científico, lógico, matemático y de sentido común.
- Verificabilidad: Las predicciones se pueden validar a través de Cambio de verdad en caché de la verdad o reexecución.
- Refinamiento iterativo: Una versión refinada, Codei/O ++, emplea revisión de múltiples vueltas Para mejorar la precisión del razonamiento.
Resultados y rendimiento empíricos
El impacto de Codei/o se probó en todo Cuatro modelos base (que varía de parámetros de 7b a 30b) en 14 puntos de referencia de razonamiento cubriendo la lógica, la inferencia simbólica, las matemáticas, la deducción científica y el razonamiento de sentido común.
Recomendaciones:
- Mejoras consistentes: El entrenamiento de Codei/o condujo a puntajes más altos en puntos de referencia de razonamiento en comparación con los métodos tradicionales previos a la altura.
- Generalización en todas las tareas: A diferencia de los enfoques existentes que mejoran las tareas específicas pero degradan el rendimiento en otros lugares, CodeI/O mostró mejoras equilibradas.
- Comparación con las líneas de base: Conjuntos de datos superados por código/o como OpenMathInstruct2, OpenCoder-SFT-Stage1 y WebInstruct.
- Efectividad del refinamiento múltiple: Codei/O ++ mejoró aún más los resultados refinando iterativamente las respuestas incorrectas, aprovechando la retroalimentación de ejecución para una mejor calidad de razonamiento.
Por ejemplo, en puntos de referencia de razonamiento lógico y simbólico como BBH y CruxevalCodei/O condujo a ganancias de rendimiento notables. En Tareas de razonamiento de matemáticas (GSM8K, Matemáticas y MMLU-STEM)demostró mejoras sobre las líneas de base existentes. Incluso en razonamiento de sentido comúndonde los métodos basados en código generalmente luchan, Codei/o mantuvo resultados sólidos.
Conclusión
Codei/o presenta una forma estructurada de mejorar el razonamiento de las LLM al aprovechar las transformaciones de entrada-salida del código del mundo real. En lugar de centrarse en tareas de razonamiento aisladas, extrae patrones de razonamiento universal y los traduce en Explicaciones del lenguaje natural. Este enfoque de aprendizaje estructurado garantiza que los modelos adquieran habilidades de razonamiento robustas en diferentes dominios.
La introducción de Revisión de múltiples vueltas (Codei/O ++) Además, refina la precisión del razonamiento, lo que demuestra que el aprendizaje iterativo de la retroalimentación de la ejecución mejora la confiabilidad del modelo. Haciendo predicciones verifiableCodeI/O proporciona un método escalable y confiable para mejorar el razonamiento de LLM.
Por unir razonamiento del lenguaje natural y basado en el códigoCodeI/O ofrece una dirección prometedora para mejorar las habilidades cognitivas de LLMS más allá de las tareas relacionadas con la programación.
Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 75k+ ml de subreddit.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.