Los modelos de lenguaje de razonamiento han demostrado la capacidad de mejorar el rendimiento mediante la generación de secuencias de cadena de pensamiento más largas durante la inferencia, aprovechando efectivamente el aumento del cálculo. Sin embargo, una limitación importante es la falta de control sobre la longitud del razonamiento, lo que dificulta la asignación de recursos computacionales de manera eficiente. En algunos casos, los modelos generan salidas excesivamente largas, desperdiciando el cálculo, mientras que en otros, se detienen demasiado pronto, lo que lleva a un rendimiento subóptimo. Los enfoques existentes a menudo degradan el rendimiento, como hacer cumplir tokens especiales como “esperar” o “respuesta final” para regular la longitud de salida. A diferencia de la generación general de texto, las tareas de razonamiento requieren un equilibrio entre la eficiencia computacional y la precisión, destacando la necesidad de un control de longitud precisa.
Investigaciones anteriores han explorado las estrategias de escala de tiempo de prueba, lo que demuestra que el aumento del cálculo de inferencia, a través de cadenas de razonamiento más largas o muestreo paralelo, mejora el rendimiento en tareas de razonamiento complejas como la resolución de problemas matemáticos y la generación de códigos. Sin embargo, los métodos actuales carecen de control de grano fino sobre la longitud del razonamiento, lo que lleva a ineficiencias. Si bien el trabajo previo sobre el control de la longitud de salida se ha centrado principalmente en modelos de seguimiento de instrucciones o generación general de texto, los modelos de razonamiento plantean desafíos únicos debido a su necesidad de ajuste dinámico de la longitud de la inferencia. Los intentos recientes, como el truncamiento forzado con presupuesto, interrumpen la coherencia del razonamiento y obstaculizan la precisión. Al abordar estas brechas, esta investigación introduce un método para controlar explícitamente la longitud del razonamiento, optimizando el costo computacional mientras mantiene el rendimiento.
Los investigadores de la Universidad Carnegie Mellon introducen la optimización de políticas controlada de longitud (LCPO), un enfoque de aprendizaje de refuerzo que mejora los modelos de razonamiento al garantizar la precisión y el cumplimiento de las restricciones de longitud especificadas por el usuario. Los modelos capacitados en LCPO, como L1, equilibran eficientemente el costo y el rendimiento de la computación al ajustar la longitud del razonamiento a través de restricciones basadas en el aviso. L1 supera el método S1 e incluso supera a GPT-4O en longitudes de razonamiento equivalentes. Además, LCPO mejora la generalización del modelo a razonamiento lógico y puntos de referencia de conocimiento como MMLU. En particular, los modelos entrenados con LCPO exhiben fuertes capacidades cortas de cadena de pensamiento, logrando una alta precisión al tiempo que mantienen un control de longitud preciso en varias tareas.
Los modelos de razonamiento tradicionales carecen de mecanismos para controlar la longitud de la salida, lo que dificulta la gestión de los presupuestos computacionales. LCPO aborda esto acondicionando el modelo en una longitud objetivo dada en el mensaje. El modelo está entrenado utilizando RL con una función de recompensa que equilibra la precisión y la adherencia a las limitaciones de longitud. Esto da como resultado dos variantes: L1-Exact, que coincide estrictamente con la longitud del objetivo, y L1-Max, que permanece dentro de una longitud máxima especificada. L1-Max permite flexibilidad mientras prioriza la corrección. Este método mejora la eficiencia al optimizar el rendimiento del razonamiento al tiempo que garantiza que el costo computacional sea manejable.
El método LCPO propuesto (L1) demuestra un rendimiento superior en la generación de texto controlado por longitud en varios puntos de referencia. L1-Exact y L1-Max superan constantemente los modelos de referencia mientras mantienen restricciones de token precisas. En comparación con S1, L1 logra 20-25% de ganancias absolutas y más del 100% relativas al adaptar efectivamente las cadenas de razonamiento sin truncamiento. L1 se generaliza bien a tareas fuera de dominio, exhibiendo una escala de rendimiento robusta. Mantiene una alta precisión en la adherencia de longitud, con una desviación mínima en las tareas de razonamiento matemático. Además, L1 emplea estrategias de razonamiento adaptativo, asignando más tokens para la autocorrección y conclusiones a largas longitudes, al tiempo que preserva un equilibrio eficiente entre los pasos de razonamiento intermedio y los resultados finales.
En conclusión, el estudio presenta LCPO, un método de aprendizaje de refuerzo que permite un control preciso sobre la duración de las cadenas de razonamiento en los modelos de idiomas. Usando LCPO, entrenamos L1, un modelo de razonamiento que se adhiere a las restricciones de longitud especificadas por el usuario al tiempo que optimizamos la precisión. L1 supera los enfoques de control de longitud previos, logrando mejoras relativas al 100% y 20% absolutas en el razonamiento matemático. Se generaliza bien a las tareas fuera de dominio y se destaca inesperadamente en un razonamiento corto de cadena de pensamiento, superando modelos más grandes como GPT-4O en igualdad de longitudes. LCPO ofrece un enfoque escalable y eficiente para equilibrar el costo y la precisión computacionales a través del simple control de longitud basado en aviso.
Verificar el Papel, Modelo en la cara abrazaday Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.
Sana Hassan, una pasante de consultoría en MarktechPost y estudiante de doble grado en IIT Madras, le apasiona aplicar tecnología e IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.