Google AI anuncia que escalar de forma óptima el cálculo en tiempo de prueba LLM puede ser más eficaz que escalar los parámetros del modelo

Los modelos de lenguaje grandes (LLM, por sus siglas en inglés) enfrentan desafíos a la hora de utilizar de manera efectiva los cálculos adicionales en el momento de la prueba para mejorar la precisión de sus respuestas, en particular para tareas complejas. Los investigadores están explorando formas de permitir que los LLM piensen más tiempo en problemas difíciles, de manera similar a la cognición humana. Esta capacidad podría potencialmente abrir nuevas vías en tareas de razonamiento y agencial, permitir que modelos más pequeños en el dispositivo reemplacen a los LLM a escala de centro de datos y proporcionar un camino hacia algoritmos generales de automejora con una supervisión humana reducida. Sin embargo, los enfoques actuales muestran resultados mixtos: algunos estudios demuestran mejoras en los resultados de los LLM utilizando cálculos en el momento de la prueba, mientras que otros revelan una efectividad limitada en tareas complejas como el razonamiento matemático. Estos hallazgos contradictorios subrayan la necesidad de un análisis sistemático de diferentes enfoques para escalar los cálculos en el momento de la prueba en los LLM.

Los investigadores han logrado avances significativos en la mejora del desempeño del modelo de lenguaje en tareas de razonamiento matemático mediante diversos enfoques. Estos incluyen el preentrenamiento continuo con datos centrados en las matemáticas, la mejora de la distribución de propuestas de LLM mediante la optimización dirigida y la revisión iterativa de las respuestas, y la habilitación de los LLM para beneficiarse de un cómputo adicional en tiempo de prueba utilizando verificadores ajustados. Se han propuesto varios métodos para aumentar los LLM con el cómputo en tiempo de prueba, como la búsqueda de hipótesis jerárquica para el razonamiento inductivo, la ampliación de herramientas y el aprendizaje de tokens de pensamiento para un uso más eficiente del cómputo adicional en tiempo de prueba. Sin embargo, la eficacia de estos métodos varía según el problema específico y el LLM base utilizado. Para problemas más fáciles donde el LLM base puede producir respuestas razonables, el refinamiento iterativo de las respuestas iniciales a través de una secuencia de revisiones puede ser más eficaz. Por el contrario, para problemas más difíciles que requieren la exploración de varios enfoques de alto nivel, el muestreo de respuestas independientes en paralelo o el empleo de la búsqueda de árboles contra un modelo de recompensa basado en procesos puede ser más beneficioso. El análisis del escalamiento del cómputo en tiempo de prueba en modelos de lenguaje, particularmente para problemas de razonamiento matemático donde se desconoce la verdad fundamental, sigue siendo un área importante de investigación.

Investigadores de la Universidad de California en Berkeley y Google DeepMind proponen un modelo adaptativo Estrategia de “computación óptima” para escalar el cálculo en tiempo de prueba en los LLM. Este enfoque selecciona el método más eficaz para utilizar cálculos adicionales en función de la dificultad de la pregunta y el tema específico. Al utilizar una medida de la dificultad de la pregunta desde la perspectiva del LLM base, los investigadores pueden predecir la eficacia del cálculo en tiempo de prueba e implementar esta estrategia óptima de cálculo en la práctica. Esta asignación adaptativa del cálculo en tiempo de prueba mejora significativamente el rendimiento de escalamiento, superando las líneas base de mejor de N mientras se utiliza aproximadamente 4 veces menos cálculo para los métodos de revisión y búsqueda. Luego, los investigadores comparan la eficacia de su estrategia mejorada de escalamiento del cálculo en tiempo de prueba con la alternativa de preentrenar modelos más grandes.

El uso de cálculos adicionales en tiempo de prueba en los LLM se puede ver a través de una perspectiva unificada de modificación de la distribución prevista del modelo de manera adaptativa en el momento de la prueba. Esta modificación se puede lograr a través de dos enfoques principales: alterar la distribución propuesta y optimizar el verificador. Para mejorar la distribución propuesta, los investigadores han explorado métodos como el ajuste fino inspirado en el RL (por ejemplo, STaR, ReSTEM) y técnicas de autocrítica. Estos enfoques permiten que el modelo mejore sus propios resultados en el momento de la prueba al criticar y revisar sus respuestas iniciales de manera iterativa. El ajuste fino de los modelos en datos de políticas con mejoras guiadas por Best-of-N ha demostrado ser prometedor en tareas de razonamiento complejas.

Para optimizar el verificador, el método tradicional de muestreo del mejor de N se puede mejorar mediante el entrenamiento de un verificador basado en procesos o un modelo de recompensa de procesos (PRM). Este enfoque permite realizar predicciones de exactitud en cada paso intermedio de una solución, en lugar de solo en la respuesta final. Al utilizar estas predicciones por paso, se puede realizar una búsqueda de árbol más eficiente y efectiva en el espacio de la solución, superando potencialmente el muestreo ingenuo del mejor de N. Estos métodos de modificación de la distribución de propuestas y optimización del verificador forman dos ejes de estudio independientes para mejorar el cálculo en tiempo de prueba para los modelos de lenguaje. La efectividad de cada enfoque puede variar según la tarea específica y las características del modelo.

El enfoque implica la selección de hiperparámetros óptimos para una estrategia dada en el momento de la prueba para maximizar los beneficios del rendimiento. Para implementar esto, los investigadores introducen un método para estimar la dificultad de las preguntas, que sirve como un factor clave para determinar la asignación de cómputo más efectiva. La dificultad de las preguntas se define utilizando el rendimiento del LLM base, agrupando las preguntas en cinco niveles de dificultad según la tasa de aprobación del modelo. Esta medida de dificultad específica del modelo demostró ser más predictiva de la eficacia del cómputo en el momento de la prueba que los compartimentos de dificultad etiquetados manualmente. Para que la estrategia sea práctica sin depender de respuestas verdaderas, la dificultad aproximada de la pregunta del investigador utiliza una noción predicha por el modelo basada en las puntuaciones del verificador aprendidas. Este enfoque permite la evaluación de la dificultad y la selección de la estrategia sin saber la respuesta correcta de antemano. Luego, la estrategia óptima para el cómputo se determina para cada compartimento de dificultad utilizando un conjunto de validación y se aplica al conjunto de prueba. Este método permite la asignación adaptativa de recursos de cómputo en el momento de la prueba, lo que potencialmente conduce a mejoras significativas en el rendimiento en comparación con las estrategias de asignación uniformes o ad hoc.

Este estudio analiza varios enfoques para optimizar el escalamiento computacional en tiempo de prueba en LLM, incluidos algoritmos de búsqueda con verificadores de procesos (PRM) y refinando la distribución de propuestas a través de revisiones. La búsqueda de haz supera al mejor de N con presupuestos de generación más bajos, pero esta ventaja disminuye a medida que aumentan los presupuestos. Las revisiones secuenciales generalmente superan al muestreo paralelo, y la relación óptima entre ambos depende de la dificultad de la pregunta. Las preguntas más fáciles se benefician más de las revisiones secuenciales, mientras que las preguntas más difíciles requieren un equilibrio entre el cómputo secuencial y paralelo. La efectividad de los métodos de búsqueda varía según la dificultad de la pregunta; la búsqueda de haz muestra mejoras en problemas de dificultad media, pero signos de sobreoptimización en los más fáciles. Al seleccionar de manera óptima las estrategias según la dificultad de la pregunta y el presupuesto computacional, el enfoque de escalamiento computacional óptimo puede superar la línea base paralela de mejor de N utilizando hasta 4 veces menos tiempo de cómputo de prueba. El estudio también revela que el cálculo en tiempo de prueba es más beneficioso para preguntas de dificultad fácil a media o en entornos con cargas de inferencia más bajas, mientras que el entrenamiento previo es más efectivo para preguntas desafiantes o requisitos de inferencia altos.

Este estudio demuestra la importancia de las estrategias adaptativas de “cómputo óptimo” para escalar los cálculos en tiempo de prueba en los LLM. Al predecir la efectividad del cálculo en tiempo de prueba en función de la dificultad de la pregunta, los investigadores implementaron una estrategia práctica que superó las líneas base del mejor de N utilizando 4 veces menos cálculo. Una comparación entre el cálculo adicional en tiempo de prueba y modelos preentrenados más grandes mostró que para las preguntas fáciles a intermedias, el cálculo en tiempo de prueba a menudo supera al preentrenamiento aumentado. Sin embargo, para las preguntas más desafiantes, el preentrenamiento adicional sigue siendo más efectivo. Estos hallazgos sugieren un cambio potencial hacia la asignación de menos FLOP al preentrenamiento y más a la inferencia en el futuro, lo que resalta el panorama cambiante de la optimización y la implementación de LLM.


Echa un vistazo a la Papel. Todo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa..

No olvides unirte a nuestro Subreddit de más de 48 000 millones de usuarios

Encuentra lo próximo Seminarios web sobre IA aquí



Asjad es consultor en prácticas en Marktechpost. Está cursando la licenciatura en ingeniería mecánica en el Instituto Indio de Tecnología de Kharagpur. Asjad es un entusiasta del aprendizaje automático y del aprendizaje profundo que siempre está investigando las aplicaciones del aprendizaje automático en el ámbito de la atención médica.