A pesar de los avances notables en los modelos de idiomas grandes (LLM), el rendimiento efectivo en las tareas intensivas en razonamiento, como la resolución de problemas matemáticos, la planificación algorítmica o la codificación, se limitan al tamaño del modelo, la metodología de capacitación y las capacidades de tiempo de inferencia. Los modelos que funcionan bien en los puntos de referencia generales de PNL a menudo carecen de la capacidad de construir cadenas de razonamiento de varios pasos o reflexionar sobre los estados intermedios de resolución de problemas. Además, si bien la ampliación del tamaño del modelo puede mejorar la capacidad de razonamiento, introduce costos prohibitivos de despliegue y de implementación, especialmente para el uso aplicado en sistemas de educación, ingeniería y soporte de decisiones.
Microsoft libera suite de modelo de razonamiento PHI-4
Microsoft introdujo recientemente la familia de razonamiento PHI-4, que consta de tres modelos,PHI-4 Razonamiento, Phi-4-Razoning-Plusy Phi-4-Mini-Razonamiento. Estos modelos se derivan de la base PHI-4 (parámetros 14B) y están específicamente capacitados para manejar tareas de razonamiento complejas en matemáticas, dominios científicos y resolución de problemas relacionados con el software. Cada variante aborda las diferentes compensaciones entre la eficiencia computacional y la precisión de salida. La conducción PHI-4 se optimiza a través del ajuste superior supervisado, mientras que Phi-4-Razoning-Plus extiende esto con el aprendizaje de refuerzo basado en resultados, particularmente dirigido al rendimiento mejorado en tareas de alta varianza, como las matemáticas a nivel de competencia.
Los modelos de peso abierto se lanzaron con detalles de capacitación transparente y registros de evaluación, incluido el diseño de referencia, y están alojados en la cara de abrazo para la reproducibilidad y el acceso público.
Composición técnica y avances metodológicos
Los modelos de condición PHI-4 se basan en la arquitectura PHI-4 con mejoras específicas para el comportamiento modelo y el régimen de entrenamiento. Las decisiones metodológicas clave incluyen:
- Autorización fino supervisada (SFT) estructurada: Más de 1,4 millones de indicaciones se seleccionaron con un enfoque en casos de “límite”: problemas en el borde de las capacidades de referencia de PHI-4. Las indicaciones se obtuvieron y se filtraron para enfatizar el razonamiento de varios pasos en lugar del recuerdo de objetivos, y las respuestas se generaron sintéticamente utilizando O3-Mini en modo de alta condición.
- Formato de cadena de pensamiento: Para facilitar el razonamiento estructurado, los modelos fueron entrenados para generar salida utilizando explícitos
<think>Etiquetas, separación alentadora entre trazas de razonamiento y respuestas finales. - Manejo de contexto extendido: La frecuencia base de la cuerda se modificó para admitir una ventana de contexto de token de 32k, lo que permite trazas de solución más profundas, particularmente relevantes en formatos de preguntas múltiples o de forma larga.
- Aprendizaje de refuerzo (Phi-4-Razoning-Plus): Utilizando la optimización de políticas relativas del grupo (GRPO), Phi-4-Rasoning-Plus se refinó aún más en un pequeño conjunto curado de ∼6,400 problemas centrados en matemáticas. Se elaboró una función de recompensa para favorecer las salidas correctas, concisas y bien estructuradas, mientras penalizan la verbosidad, la repetición y las violaciones de formato.
Este régimen de capacitación centrado en los datos y conscientes del formato respalda una mejor utilización de tiempo de inferencia y generalización del modelo en todos los dominios, incluidos los problemas de razonamiento simbólicos invisibles.
Evaluación y rendimiento comparativo
En una amplia gama de puntos de referencia de razonamiento, la conducción PHI-4 y la realización de PHI-4-más, más ofrecen resultados competitivos en relación con modelos de peso abierto significativamente más grandes:
Phi-4-Razoning-Plus muestra un fuerte rendimiento no solo en evaluaciones específicas de dominio, sino que también generaliza bien a problemas de planificación y combinatorios como TSP y 3SAT, a pesar de que no hay capacitación explícita en estas áreas. Las ganancias de rendimiento también se observaron en el seguimiento de las instrucciones (IFEVal) y el control de calidad de contexto largo (FLENQA), lo que sugiere que la formulación de la cadena de pensamiento mejora la utilidad del modelo más amplia.
Es importante destacar que Microsoft informa que las distribuciones de varianza completa en más de 50 años se ejecutan para conjuntos de datos confidenciales como AIME 2025, revelando que el PHI-4 Rasoning-Plus-Plus coincide o excede la consistencia del rendimiento de modelos como O3-Mini, al tiempo que queda en disjunta de distribuciones basales más pequeñas como DeepSeek-R1-Distill.
Conclusión e implicaciones
Los modelos de razonamiento PHI-4 representan un esfuerzo metodológicamente riguroso para avanzar en pequeñas capacidades del modelo en el razonamiento estructurado. Al combinar la capacitación centrada en datos, el ajuste arquitectónico y el aprendizaje de refuerzo mínimo pero bien dirigido, Microsoft demuestra que los modelos a escala de 14b pueden igualar o superar a los sistemas mucho más grandes en tareas que requieren inferencia y generalización de múltiples pasos.
La disponibilidad de peso abierta de los modelos y la evaluación comparativa transparente establecen un precedente para el desarrollo futuro en pequeños LLM, particularmente para dominios aplicados donde la interpretabilidad, el costo y la confiabilidad son primordiales. Se espera que el trabajo futuro extienda las capacidades de razonamiento a campos STEM adicionales, mejore las estrategias de decodificación y explore el aprendizaje de refuerzo escalable en horizontes más largos.
Mira el Papel, Página de Huggingface y Blog de Microsoft. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 90k+ ml de subreddit.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.