Prefijo-RFT: un marco de aprendizaje automático unificado para combinar el ajuste superior (SFT) y el refuerzo de refuerzo (RFT)

Los modelos de lenguaje grande se refinan típicamente después de pretrarse utilizando ajuste fino (SFT) supervisado o refuerzo de ajuste fino (RFT), cada uno con fuerzas y limitaciones distintas. SFT es efectivo en la enseñanza de instrucciones a través del aprendizaje basado en ejemplo, pero puede conducir a un comportamiento rígido y una generalización deficiente. RFT, por otro lado, optimiza los modelos para el éxito de las tareas utilizando señales de recompensa, que pueden mejorar el rendimiento, pero también introducir inestabilidad y dependencia de una política inicial sólida. Si bien estos métodos a menudo se usan secuencialmente, su interacción sigue siendo poco conocida. Esto plantea una pregunta importante: ¿cómo podemos diseñar un marco unificado que combine la estructura de SFT con el aprendizaje basado en objetivos de RFT?

La investigación en la intersección de RL y LLM después del entrenamiento ha ganado impulso, particularmente para capacitar modelos con capacidad de razonamiento. Offline RL, que aprende de conjuntos de datos fijos, a menudo produce políticas subóptimas debido a la diversidad limitada de los datos. Esto ha provocado interés en combinar enfoques de RL fuera de línea y en línea para mejorar el rendimiento. En LLMS, la estrategia dominante es aplicar primero SFT para enseñar comportamientos deseables, luego usar RFT para optimizar los resultados. Sin embargo, la dinámica entre SFT y RFT todavía no se entiende bien, y encontrar formas efectivas de integrarlas sigue siendo un desafío de investigación abierto.

Investigadores de la Universidad de Edimburgo, Universidad de Fudan, Alibaba Group, Stepfun y la Universidad de Amsterdam proponen un marco unificado que combina el ajuste supervisado y el refuerzo de una manera llamada prefijo-RFT. Este método guía la exploración utilizando demostraciones parciales, lo que permite que el modelo continúe generando soluciones con flexibilidad y adaptabilidad. Probado en tareas de razonamiento de matemáticas, el prefijo-rft supera constantemente los métodos independientes de SFT, RFT y de política mixta. Se integra fácilmente en los marcos existentes y resulta robusto a los cambios en la calidad y cantidad de demostración. Combinar el aprendizaje basado en la demostración con exploración puede conducir a una capacitación más efectiva y adaptativa de modelos de idiomas grandes.

https://arxiv.org/abs/2507.01679

El estudio presenta el ajuste fino de refuerzo de prefijo (prefijo-rft) como una forma de combinar las fortalezas de SFT y RFT. Si bien SFT ofrece estabilidad al imitar demostraciones de expertos, RFT fomenta la exploración mediante el uso de señales de recompensa. El prefijo-rft une los dos utilizando una demostración parcial (un prefijo) y dejando que el modelo genere el resto. Este enfoque guía el aprendizaje sin depender demasiado de la supervisión completa. Incorpora técnicas como recorte basado en entropía y un programador de descomposición de coseno para garantizar una capacitación estable y un aprendizaje eficiente. En comparación con los métodos anteriores, Prefix-RFT ofrece una estrategia de ajuste más equilibrada y adaptativa.

Prefix-RFT es un método de ajuste fino de recompensa que mejora el rendimiento utilizando conjuntos de datos de matemáticas fuera de línea de alta calidad, como OpenR1-Math-220k (46k problemas filtrados). Probado en Qwen2.5-Math-7B, 1.5B y Llama-3.1-8B, se evaluó en puntos de referencia, incluidos AIME 2024/25, AMC, Math500, Minerva y Olympiadbench. Prefije-RFT logró los puntajes AVG@32 y aprobados en las tareas, superando a RFT, SFT, REFIG y Luffy. Usando el Dr. Grpo, actualizó solo los tokens de prefijo de alta entropía del 20% superior, con la longitud de prefijo que decae del 95% al ​​5%. Mantuvo la pérdida intermedia de SFT, lo que indica un fuerte equilibrio entre imitación y exploración, especialmente en problemas difíciles (Trainhard).

https://arxiv.org/abs/2507.01679

En conclusión, el prefijo-RFT combina las fortalezas de SFT y RFT utilizando prefijos de demostración muestreados para guiar el aprendizaje. A pesar de su simplicidad, supera constantemente las líneas de base SFT, RFT e híbridas en varios modelos y conjuntos de datos. Incluso con solo el 1% de los datos de capacitación (450 indicaciones), mantiene un rendimiento fuerte (AVG@32 caídas solo de 40.8 a 37.6), mostrando eficiencia y robustez. Su estrategia de actualización de token basada en la entropía del 20% superior resulta más efectiva, logrando los puntajes de referencia más altos con resultados más cortos. Además, el uso de un programador de descomposición de coseno para la longitud del prefijo mejora la estabilidad y la dinámica de aprendizaje en comparación con una estrategia uniforme, particularmente en tareas complejas como el AIME.


Mira el Papel aquí. No dude en ver nuestro Página de Github para tutoriales, códigos y cuadernos. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Sana Hassan, una pasante de consultoría en MarktechPost y estudiante de doble grado en IIT Madras, le apasiona aplicar tecnología e IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.