Polaris-4B y Polaris-7b: Aprendizaje de refuerzo posterior al entrenamiento para un razonamiento eficiente de matemáticas y lógica

La creciente necesidad de modelos de razonamiento escalable en inteligencia mecánica

Los modelos de razonamiento avanzado están en la frontera de la inteligencia de la máquina, especialmente en dominios como la resolución de problemas matemáticos y el razonamiento simbólico. Estos modelos están diseñados para realizar cálculos de varios pasos y deducciones lógicas, a menudo generando soluciones que reflejan los procesos de razonamiento humano. Las técnicas de aprendizaje de refuerzo se utilizan para mejorar la precisión después del previación; Sin embargo, escalar estos métodos al tiempo que retiene la eficiencia sigue siendo un desafío complejo. A medida que aumenta la demanda para modelos más pequeños y más eficientes en recursos que aún exhiben una alta capacidad de razonamiento, los investigadores ahora están recurriendo a estrategias que abordan la calidad de los datos, los métodos de exploración y la generalización de contexto a largo plazo.

Desafíos en el aprendizaje de refuerzo para grandes arquitecturas de razonamiento

Un problema persistente con el aprendizaje de refuerzo para los modelos de razonamiento a gran escala es el desajuste entre la capacidad del modelo y la dificultad de los datos de entrenamiento. Cuando un modelo está expuesto a tareas que son demasiado simples, su curva de aprendizaje se estanca. Por el contrario, los datos demasiado difíciles pueden abrumar el modelo y no producir una señal de aprendizaje. Esta dificultad de desequilibrio es especialmente pronunciada al aplicar recetas que funcionan bien para modelos pequeños a los más grandes. Otro problema es la falta de métodos para adaptar eficientemente la diversidad de despliegue y la longitud de salida durante el entrenamiento e inferencia, lo que limita aún más las habilidades de razonamiento de un modelo en puntos de referencia complejos.

Limitaciones de los enfoques de post-entrenamiento existentes en modelos avanzados

Los enfoques anteriores, como DeepScaler y GRPO, han demostrado que el aprendizaje de refuerzo puede mejorar el rendimiento de los modelos de razonamiento a pequeña escala con tan solo 1.500 millones de parámetros. Sin embargo, la aplicación de estas mismas recetas a modelos más capaces, como QWEN3-4B o Deepseek-R1-Distill-Qwen-7b, resulta solo en ganancias marginales o incluso caídas de rendimiento. Una limitación clave es la naturaleza estática de la distribución de datos y la diversidad limitada del muestreo. La mayoría de estos enfoques no filtran datos en función de la capacidad del modelo, ni ajustan la temperatura de muestreo o la longitud de la respuesta con el tiempo. Como resultado, a menudo no pueden escalar de manera efectiva cuando se usan en arquitecturas más avanzadas.

Introducción de Polaris: una receta personalizada para RL escalable en tareas de razonamiento

Investigadores de la Universidad de Hong Kong, Bytedance Seed y Fudan University introdujeron Polaris, una receta posterior al entrenamiento diseñada específicamente para el aprendizaje de refuerzo de escala para tareas de razonamiento avanzado. Polaris incluye dos modelos de vista previa: Polaris-4B-Preview y Polaris-7b-Preview. Polaris-4B-Preview está ajustado de QWEN3-4B, mientras que Polaris-7B-Preview se basa en Deepseek-R1-Distill-Qwen-7b. Los investigadores se centraron en construir un marco agnóstico modelo que modifica la dificultad de los datos, fomenta diversas exploración a través de temperaturas de muestreo controladas y extiende las capacidades de inferencia a través de la extrapolación de longitud. Estas estrategias se desarrollaron utilizando conjuntos de datos de código abierto y tuberías de capacitación, y ambos modelos están optimizados para ejecutarse en unidades de procesamiento de gráficos de grado consumidor (GPU).

Innovaciones de Polaris: dificultad para equilibrar, muestreo controlado e inferencia de contexto largo

Polaris implementa múltiples innovaciones. Primero, los datos de capacitación se seleccionan eliminando problemas que son demasiado fáciles o no posibles, creando una distribución de dificultad con forma de J reflejada. Esto garantiza que los datos de entrenamiento evolucionen con las capacidades de creciente del modelo. En segundo lugar, los investigadores ajustan dinámicamente la temperatura de muestreo a través de las etapas de entrenamiento, utilizando 1.4, 1.45 y 1.5 para Polaris-4B y 0.7, 1.0 y 1.1 para Polaris-7b, para mantener la diversidad de despliegue. Además, el método emplea una técnica de extrapolación basada en hilos para extender la longitud de contexto de inferencia a tokens de 96k sin requerir capacitación adicional. Esto aborda la ineficiencia de la capacitación de secuencia larga al permitir un enfoque de “trenes, de largo y duración”. El modelo también emplea técnicas como el mecanismo de rescate de despliegue y la sustitución informativa intra-lota para evitar lotes de recompensa cero y garantizar que se conserven señales de entrenamiento útiles, incluso cuando el tamaño del despliegue se mantiene pequeño en 8.

Resultados de referencia: Polaris supera a los modelos comerciales más grandes

Los modelos Polaris logran resultados de última generación en múltiples puntos de referencia de matemáticas. Polaris-4b-previa registra el 81.2% de precisión en AIME24 y 79.4% en AIME25, superando incluso QWEN3-32B en las mismas tareas mientras usa menos del 2% de sus parámetros. Obtiene 44.0% en Minerva Math, 69.1% en Olympiad Bench y 94.8% en AMC23. Polaris-7b-previa también funciona fuertemente, anotando un 72.6% en AIME24 y 52.6% en AIME25. Estos resultados demuestran una mejora consistente sobre modelos como Claude-4-OPUS y GROK-3-BETA, estableciendo Polaris como un modelo competitivo y liviano que une la brecha de rendimiento entre los pequeños modelos abiertos y los modelos comerciales de 30B+.

Conclusión: aprendizaje de refuerzo eficiente a través de estrategias de post-entrenamiento inteligentes

Los investigadores demostraron que la clave para escalar modelos de razonamiento no es solo un tamaño de modelo más grande sino un control inteligente sobre la dificultad de los datos de entrenamiento, la diversidad de muestreo y la longitud de la inferencia. Polaris ofrece una receta reproducible que sintoniza efectivamente estos elementos, lo que permite que los modelos más pequeños rivalicen la capacidad de razonamiento de los sistemas comerciales masivos.


Mira el Modelo y Código. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.