Introducción: la necesidad de RL eficiente en LRMS
El aprendizaje de refuerzo RL se usa cada vez más para mejorar las LLM, especialmente para las tareas de razonamiento. Estos modelos, conocidos como grandes modelos de razonamiento (LRM), generan pasos intermedios de “pensamiento” antes de proporcionar respuestas finales, mejorando así el rendimiento en problemas complejos como las matemáticas y la codificación. Sin embargo, la capacitación de LRM con RL a escala es un desafío debido a la necesidad de una paralelización masiva y un diseño eficiente del sistema. Los sistemas actuales a menudo dependen del procesamiento de lotes sincrónicos, donde la generación debe esperar a que la salida más larga en un lote finalice, lo que lleva a la subutilización de GPU. Incluso los métodos más nuevos aún enfrentan cuellos de botella, ya que usan despliegue obsoletos pero permanecen basados en lotes.
Antecedentes: aprendizaje de refuerzo El impacto de RL en las habilidades de razonamiento de LLM
El aprendizaje de refuerzo RL se ha convertido en una estrategia ampliamente utilizada para mejorar las habilidades de razonamiento de LLM, particularmente para tareas con señales de recompensa claramente definidas, como matemáticas, codificación, razonamiento científico y uso de herramientas. Estos modelos generalmente mejoran extendiendo su razonamiento de la cadena de pensamiento durante el entrenamiento. Los esfuerzos de código abierto han demostrado que los modelos destilados y más pequeños también pueden funcionar bien en tales tareas. Recientemente se han explorado los métodos asíncronos RL, con efectivo en los juegos, para LLMS, pero principalmente en escenarios de contexto corto o supervisión limitada. El trabajo previo también ha investigado estrategias, como despliegue parcial, para mejorar la eficiencia al tiempo que mantiene la estabilidad de la capacitación.
Descripción general del sistema: Introducción de Areal
Los investigadores de III, la Universidad de Tsinghua, Ant Research y HKust introducen Areal, un sistema de aprendizaje de refuerzo totalmente asincrónico diseñado para capacitar a grandes modelos de razonamiento de manera más eficiente. A diferencia de los sistemas sincrónicos tradicionales, el área separa los procesos de generación y capacitación; Los trabajadores implementados producen continuamente resultados, mientras que los trabajadores de la capacitación actualizan el modelo en paralelo a medida que llegan los nuevos datos. Este diseño mejora el uso de GPU y acelera la capacitación. Para manejar el estancamiento de los datos, AREEAL utiliza una versión personalizada de PPO e incorpora optimizaciones como los servicios dinámicos de lotes y recompensas paralelas. En las tareas de matemáticas y de código, AREAL logra hasta 2.77 × capacitación más rápida mientras mantiene o mejora el rendimiento final del modelo.
Arquitectura técnica: componentes y optimizaciones clave
Areal está diseñado para desacoplar la generación y el entrenamiento en grupos de GPU separados, mejorando la escalabilidad, la eficiencia del hardware y la flexibilidad para el aprendizaje de refuerzo con modelos grandes. El sistema incluye cuatro componentes principales: trabajadores despliegados que admiten actualizaciones de generación y modelos de generación interrumpible, un servicio de recompensas que evalúa las respuestas, los trabajadores de los capacitadores que realizan actualizaciones de PPO y un controlador que coordina el flujo de datos. Para abordar desafíos como el estancamiento de los datos y las versiones de políticas inconsistentes, Areal emplea la capacitación consciente de la incomodidad y un objetivo PPO desacoplado. Además, las optimizaciones a nivel del sistema, como las operaciones de CPU-GPU de tuberías, las solicitudes asíncronas sin bloqueo y el empaque de secuencia dinámica mejoran la velocidad de entrenamiento y la eficiencia de la GPU.
Resultados experimentales: escala y rendimiento
Areeal se probó en tareas de matemáticas y codificación utilizando modelos QWEN2 destilados de varios tamaños. Logró un entrenamiento de 2 a 3 veces más rápido que los métodos anteriores, como Deepcaler y Deepcoder, al tiempo que mantiene una precisión comparable. El sistema escala de manera eficiente a través de GPU y maneja largas longitudes de contexto (hasta 32k tokens), superando las características clave de diseño de métodos sincrónicos, como la generación de interrupción y la matriz dinámica, que aumentan la velocidad de entrenamiento y la utilización del hardware. Algorítmicamente, el objetivo PPO desacoplado de Areal permite el aprendizaje estable incluso con datos obsoletos, a diferencia de PPO estándar. En general, los saldos de área de la velocidad y el rendimiento de manera efectiva, lo que lo hace bien adecuado para la capacitación RL a gran escala de modelos de idiomas.
Conclusión: avance de RL a gran escala para modelos de idiomas
En conclusión, Areal es un sistema de aprendizaje de refuerzo asíncrono diseñado para mejorar la eficiencia de la capacitación de LLM, particularmente para tareas como la codificación y el razonamiento matemático. A diferencia de los métodos sincrónicos tradicionales que esperan todas las salidas antes de actualizarse, Areal permite que la generación y la capacitación se ejecuten en paralelo. Este desacoplamiento reduce el tiempo de inactividad de GPU y aumenta el rendimiento. Para garantizar que el aprendizaje se mantenga estable, el área introduce estrategias con conocimiento de estallidad y un algoritmo PPO modificado que maneja efectivamente los datos de capacitación más antiguos. Los experimentos muestran que ofrece una capacitación hasta 2.77 veces más rápida que los sistemas sincrónicos, sin sacrificar la precisión, marcando un paso adelante en la ampliación de RL para modelos grandes.
Mira el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.
Sana Hassan, una pasante de consultoría en MarktechPost y estudiante de doble grado en IIT Madras, le apasiona aplicar tecnología e IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.