Los avances recientes en los modelos de lenguaje centrados en el razonamiento han marcado un cambio importante en la IA al escalar el cálculo del tiempo de prueba. El aprendizaje de refuerzo (RL) es crucial para desarrollar capacidades de razonamiento y mitigar las trampas de piratería de recompensas. Sin embargo, queda un debate fundamental: si RL proporciona nuevas capacidades de razonamiento de un modelo base o simplemente ayuda a optimizar la eficiencia de muestreo de las soluciones existentes. La investigación actual enfrenta dos limitaciones críticas: (a) una gran dependencia de dominios especializados, como las matemáticas, donde los modelos a menudo están sobrecargados y restringen el potencial de exploración, y (b) la terminación prematura de la capacitación RL antes de los modelos puede desarrollar completamente nuevas capacidades de razonamiento, generalmente limitando la capacitación a cientos de pasos.
Los modelos de razonamiento representan sistemas de IA especializados que participan en procesos de cuna largos y detallados antes de generar respuestas finales. Deepseek y Kimi tienen metodologías detalladas para capacitar modelos de razonamiento que utilizan el aprendizaje de refuerzo con recompensas verificables (RLVR), haciendo algoritmos como GRPO, descenso de espejo y Rloo popular. Recientemente, métodos como Alphago y Alphazero han demostrado que los agentes de IA pueden mejorar indefinidamente su rendimiento, lo que demuestra que la capacitación de RL ayuda a los agentes a desarrollar técnicas novedosas que no están presentes en sus modelos base. Además, los trabajos existentes cuestionan si la capacitación RL realmente mejora la capacidad de razonamiento en LLMS, argumentando que RLVR no puede extender la capacidad de razonamiento, como lo demuestra las métricas Pass@K que no muestran una mejora en comparación con los modelos base.
Investigadores de NVIDIA han propuesto Prorl, un método diseñado para permitir períodos de capacitación RL extendidos, ayudando a una exploración más profunda de las estrategias de razonamiento. Prorl admite más de 2,000 pasos de capacitación y datos de capacitación en diversas tareas, como matemáticas, codificación, problemas de ciencias, rompecabezas lógicos e instrucciones de siguientes. Utilizando Prorl, los investigadores desarrollaron Nemotron-Research-Razoning-Qwen-1.5b, el mejor modelo de razonamiento 1.5B del mundo, que supera a su modelo base, Deepseek-R1-1.5b, y sobresale sobre Deepseek-R1-7B en diversos puntos de referencia. Demuestra que RL puede descubrir vías de solución realmente nuevas que no están presentes en los modelos base cuando se les da suficiente tiempo de entrenamiento y se aplica a nuevas tareas de razonamiento, lo que sugiere una expansión genuina de las capacidades de razonamiento más allá de la capacitación inicial.
Los investigadores construyeron un conjunto de datos de capacitación diverso y verificable que abarca 136,000 ejemplos en cinco dominios de tareas: matemáticas, código, STEM, rompecabezas lógicos e instrucciones seguidas. La capacitación utiliza el marco de verl para la implementación de RL, adoptando mejoras del método GRPO propuesto por DAPO. Una amplia gama de puntos de referencia de evaluación se utilizan en múltiples dominios para probar el modelo propuesto: la evaluación de matemáticas incluye AIME2024, AIME2025, AMC, Math, Minerva Math y Olympiad Bench; La evaluación de codificación utiliza el conjunto de validación Prime, HumanevalPlus y LivecodeBench; La evaluación de los rompecabezas lógicos reserva 100 muestras de las tareas del gimnasio de razonamiento, mientras que el razonamiento STEM y la instrucción siguiendo las capacidades se evalúan utilizando subconjuntos seleccionados de GPQA Diamond e Ifeval, respectivamente.
En Matemáticas, Nemotron-Research-Razoning-Qwen-1.5b logra una mejora promedio de 15.7% en los puntos de referencia, mientras que las tareas de programación competitiva muestran una mejora del 14.4% en la precisión del pase@1. El razonamiento del vástago e instrucción siguientes dominios dan como resultado un 25.9% de ganancias en GPQA Diamond y 22.0% en Ifeval. El modelo muestra una mejora del 54.8% en recompensa, que muestra una alta precisión en los rompecabezas lógicos del gimnasio de razonamiento. La evaluación fuera de distribución revela mejoras significativas en tres tareas de gimnasio de razonamiento invisibles, destacando una generalización efectiva más allá de la distribución de capacitación. En comparación con los modelos de dominio, DeepScaler-1.5b y DeepCoder-1.5b, el modelo entrenado con Prorl alcanza los puntajes superiores Pass@1 en los puntos de referencia matemáticos (+4.6%) y de código (+6.5%).
En este documento, los investigadores introdujeron Prorl, que proporciona evidencia de que una capacitación RL extendida y estable desarrolla nuevos patrones de razonamiento más allá de las capacidades iniciales de un modelo base. Basado en este método, los investigadores desarrollaron Nemotron-Research-Razoning-Qwen-1.5b, el mejor modelo de razonamiento de 1.5B del mundo. Prorl demuestra su capacidad para resolver tareas donde los modelos base inicialmente luchan, lo que demuestra que el entrenamiento extendido de RL ayuda a los modelos internalizar patrones de razonamiento abstracto, transferibles más allá de las distribuciones de entrenamiento. Estos resultados desafían los supuestos anteriores sobre las limitaciones de RL y establecen que el tiempo de entrenamiento suficiente con las técnicas adecuadas puede aumentar los límites de razonamiento, allanando el camino para desarrollar modelos de razonamiento más capaces.
Mira el Papel y Página modelo . Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 95k+ ml de subreddit y suscribirse a Nuestro boletín.
Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.
