Gestión de presupuesto de inferencia adaptativa en modelos de idiomas grandes a través de la optimización de políticas restringidas

Los modelos de idiomas grandes (LLM) han demostrado capacidades notables en tareas de razonamiento complejos, particularmente en aplicaciones matemáticas de resolución de problemas y codificación. La investigación ha demostrado una fuerte correlación entre la longitud de las cadenas de razonamiento y la mejor precisión en los resultados de resolución de problemas. Sin embargo, enfrentan desafíos significativos: si bien los procesos de razonamiento extendidos mejoran las capacidades de resolución de problemas, a menudo conducen a soluciones ineficientes. Los modelos tienden a generar cadenas de razonamiento innecesariamente largas incluso para preguntas simples que podrían resolverse más directamente. Este enfoque único para la longitud de razonamiento crea ineficiencia computacional y reduce la utilidad práctica de estos sistemas en aplicaciones del mundo real.

Han surgido varias metodologías para mejorar las capacidades de razonamiento de LLMS, con la cadena de pensamiento (COT) un enfoque fundamental que mejora la resolución de problemas al romper el razonamiento en pasos discretos. Sobre la base de la COT, los investigadores han desarrollado técnicas más complejas, como cuna extendida con pasos adicionales, mecanismos de autorreflexión, razonamiento múltiple y sistemas de debate de múltiples agentes. Los desarrollos recientes se han centrado en ampliar la longitud del razonamiento, como lo demuestran modelos como OpenAI-O1 y Deepseek-R1. Sin embargo, generan cadenas de razonamiento extensas independientemente de la complejidad del problema. Este enfoque ineficiente aumenta los costos computacionales y las huellas de carbono más grandes.

Investigadores de Meta AI y la Universidad de Illinois Chicago han propuesto un enfoque innovador para abordar las ineficiencias en el razonamiento de LLM mediante el desarrollo de un sistema que ajuste automáticamente las longitudes de trazas de razonamiento según la complejidad de la consulta. Si bien los métodos heurísticos anteriores han intentado mejorar la eficiencia del token para una mejor precisión con una sobrecarga reducida, esta nueva investigación toma una perspectiva de aprendizaje de refuerzo (RL). En lugar de modelar explícitamente las longitudes de respuesta o equilibrar recompensas intrínsecas y extrínsecas, los investigadores han desarrollado una metodología de agrupación, que implica clasificar las respuestas en grupos distintos en función de sus características, creando un marco integral para cubrir todo el espacio de respuesta mientras se mantiene la eficiencia.

La metodología propuesta emplea un sistema de notación a nivel de secuencia que simplifica las complejas probabilidades de transición y las recompensas intermedias tratando cada respuesta como una unidad completa. La arquitectura divide las respuestas en dos grupos principales, uno para respuestas de cadena de pensamiento de longitud regular y la otra para respuestas extendidas, cada una con distintos costos de inferencia. El sistema opera a través de un marco de optimización de niveles de nivel, donde las restricciones de asignación de recursos se definen dentro de un politope convexo que limita la masa de densidad de cada grupo. Además, el algoritmo utiliza un enfoque iterativo, resolviendo el problema de nivel superior a través de actualizaciones de gradiente mientras aborda directamente la optimización de nivel inferior en cada iteración.

Los resultados experimentales demuestran mejoras significativas de rendimiento en las diferentes implementaciones de la metodología propuesta. Las construcciones supervisadas de ajuste fino (SFT), SVSFT y ASV-SFT-1, logran métricas mejoradas de pase@1, aunque a costa de mayores requisitos de inferencia. Más notablemente, la formulación ASV-IUB-Q+ con parámetros establecidos en 50% y 75% muestra mejoras de eficiencia notables, reduciendo los costos en un 4.14% a 2.16 veces y 5.74% a 4.32 veces respectivamente, coincidiendo con el rendimiento de la puntuación, una rl- líder Método de autocorrección basado. Los hallazgos también revelan una limitación notable de los métodos basados ​​en la solicitud y basados ​​en SFT tanto en las métricas de mejora absoluta como de eficiencia, lo que sugiere que las capacidades de autocorrección surgen de manera más efectiva a través de RL.

En conclusión, los investigadores introdujeron un método para superar las ineficiencias en el razonamiento de LLM. Además, introdujeron IBPO, un marco de optimización de políticas limitado que implementa un mecanismo de actualización de ajuste fino supervisado ponderado. Este enfoque determina los pesos óptimos a través de una solución de programación lineal entera, en cada iteración, basada en el marco CGPO. Si bien el sistema muestra la adherencia de restricción efectiva y la asignación de presupuesto de inferencia dinámica en tareas de razonamiento matemático, las limitaciones de recursos computacionales se pueden abordar mediante la acumulación de muestras en múltiples pasos. Las instrucciones de investigación futuras incluyen expandir la aplicabilidad del marco en diferentes aplicaciones LLM y ampliar las implementaciones experimentales para probar todo su potencial en varios contextos.


Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 75k+ ml de subreddit.

🚨 Plataforma de IA de código abierto recomendada: ‘Intellagent es un marco múltiple de código abierto para evaluar el complejo sistema de IA conversacional(Promocionado)


Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.