Bytedance Research libera DAPO: un sistema de aprendizaje de refuerzo LLM de origen completo a escala

El aprendizaje de refuerzo (RL) se ha vuelto central para avanzar en los modelos de idiomas grandes (LLM), empoderándolos con capacidades de razonamiento mejoradas necesarias para tareas complejas. Sin embargo, la comunidad de investigación enfrenta desafíos considerables en la reproducción de técnicas RL de última generación debido a la divulgación incompleta de los detalles clave de la capacitación por parte de los principales actores de la industria. Esta opacidad ha limitado el progreso de esfuerzos científicos más amplios e investigación colaborativa.

Los investigadores de Bytedance, la Universidad de Tsinghua y la Universidad de Hong Kong introdujeron recientemente DAPO (Optimización de la política de muestreo dinámico), un sistema de aprendizaje de refuerzo a gran escala de código abierto diseñado para mejorar las habilidades de razonamiento de los modelos de idiomas grandes. El sistema DAPO busca cerrar la brecha en la reproducibilidad compartiendo abiertamente todos los detalles algorítmicos, procedimientos de capacitación y conjuntos de datos. Construido sobre el marco de Verl, DAPO incluye códigos de capacitación y un conjunto de datos completamente preparado llamado DAPO-MATH-17K, específicamente diseñado para tareas de razonamiento matemático.

La base técnica de DAPO incluye cuatro innovaciones principales destinadas a resolver desafíos clave en el aprendizaje de refuerzo. El primero, “Clip-Highter”, aborda el tema del colapso de entropía, una situación en la que los modelos se establecen prematuramente en patrones de exploración limitados. Al administrar cuidadosamente la relación de recorte en las actualizaciones de políticas, esta técnica fomenta una mayor diversidad en los resultados del modelo. El “muestreo dinámico” contrarresta las ineficiencias en el entrenamiento mediante el filtrado dinámico de muestras en función de su utilidad, asegurando así una señal de gradiente más consistente. La “pérdida de gradiente de política a nivel de token” ofrece un método de cálculo de pérdida refinado, enfatizando los ajustes a nivel de token en lugar de a nivel de muestra para acomodar mejor las longitudes variables de las secuencias de razonamiento. Por último, la “conformación de recompensa demasiado larga” introduce una penalización controlada por respuestas excesivamente largas, guiando suavemente los modelos hacia un razonamiento conciso y eficiente.

En la experimentación práctica, DAPO ha demostrado mejoras significativas. Las evaluaciones sobre el American Invitational Mathematics Examination (AIME) 2024 Benchmark muestran que los modelos entrenados con DAPO alcanzaron una puntuación de 50 puntos utilizando el modelo base Qwen2.5-32b, mejorando los métodos anteriores como Deepseek-R1-Zero-Qwen-32b, que logró 47 puntos. En particular, DAPO logró esta mejora con aproximadamente la mitad de los pasos de capacitación, lo que subraya la eficiencia de los métodos propuestos. Un análisis sistemático reveló mejoras incrementales de cada técnica introducida, pasando de una línea de base de 30 puntos (usando GRPO solo) hasta 50 puntos con la metodología DAPO completa.

Más allá de los resultados cuantitativos, la dinámica de entrenamiento de DAPO proporcionó información sobre los patrones de razonamiento en evolución del modelo. Inicialmente, los modelos mostraron poco comportamiento reflexivo, a menudo procediendo linealmente a través de tareas sin reconsiderar los pasos anteriores. Sin embargo, con el entrenamiento continuo, los modelos exhibieron progresivamente comportamientos más reflexivos, lo que demuestra una forma de autovisión iterativa. Este cambio resalta la capacidad del aprendizaje de refuerzo no solo para mejorar las vías de razonamiento existentes sino también para cultivar estrategias cognitivas completamente nuevas a lo largo del tiempo.

En conclusión, la fuente abierta de DAPO representa una contribución significativa a la comunidad de aprendizaje de refuerzo, eliminando las barreras previamente creadas por metodologías inaccesibles. Al documentar claramente y proporcionar acceso integral a las técnicas, el conjunto de datos y el código del sistema, esta iniciativa de colaboración invita a más investigaciones e innovación. Los esfuerzos combinados de Bytedance, la Universidad de Tsinghua y la Universidad de Hong Kong muestran el potencial de la investigación transparente y cooperativa para avanzar en la comprensión colectiva y las capacidades prácticas de los sistemas de aprendizaje de refuerzo a gran escala.


Verificar el Papel y Página del proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.