OpenAI ha presentado GPT-5.1-Codex-Max, un modelo de codificación agente de vanguardia diseñado para tareas de ingeniería de software de larga duración que abarcan millones de tokens y sesiones de varias horas. Está disponible hoy dentro de Codex en la CLI, la extensión IDE, la integración en la nube y las superficies de revisión de código, y el acceso a la API está previsto próximamente.
¿Para qué está optimizado GPT-5.1-Codex-Max?
GPT-5.1-Codex-Max se basa en una actualización del modelo de razonamiento fundamental de OpenAI. Este modelo base está entrenado en tareas de agente en ingeniería de software, matemáticas, investigación y otros dominios. Además de esto, GPT-5.1-Codex-Max está capacitado en cargas de trabajo de ingeniería de software del mundo real, como creación de relaciones públicas, revisión de código, codificación de interfaz y preguntas y respuestas.
El modelo apunta a evaluaciones de codificación de frontera en lugar de chat general. GPT-5.1-Codex-Max y la familia Codex más amplia se recomiendan solo para tareas de codificación agente en entornos Codex o similares, no como reemplazo directo de GPT-5.1 en conversaciones de propósito general.
GPT-5.1-Codex-Max es también el primer modelo de Codex capacitado para operar en entornos Windows. Su capacitación incluye tareas que lo convierten en un mejor colaborador en la CLI del Codex, incluido un comportamiento mejorado al ejecutar comandos y trabajar con archivos en el entorno limitado del Codex.
Compactación y tareas de larga duración.
Una característica principal de GPT-5.1-Codex-Max es la compactación. El modelo aún se ejecuta dentro de una ventana de contexto fija, pero está entrenado de forma nativa para trabajar en múltiples ventanas de contexto podando su historial de interacción y preservando al mismo tiempo la información más importante en horizontes prolongados.
En las aplicaciones Codex, GPT-5.1-Codex-Max compacta automáticamente su sesión cuando se acerca al límite de la ventana de contexto. Crea una nueva ventana de contexto que mantiene el estado esencial de la tarea y luego continúa la ejecución. Este proceso se repite hasta que se completa la tarea.
OpenAI informa evaluaciones internas en las que GPT-5.1-Codex-Max funciona de forma independiente durante más de 24 horas en una sola tarea. Durante estas ejecuciones, el modelo itera sobre su implementación, corrige las pruebas fallidas y, finalmente, produce un resultado exitoso.
Esfuerzo de razonamiento, velocidad y eficiencia simbólica.
GPT-5.1-Codex-Max utiliza el mismo control del esfuerzo de razonamiento introducido con GPT-5.1, pero optimizado para agentes de codificación. El esfuerzo de razonamiento selecciona cuántas fichas de pensamiento utiliza el modelo antes de comprometerse con una respuesta.
En SWE-bench Verified, GPT-5.1-Codex-Max con un esfuerzo de razonamiento medio logra una mayor precisión que GPT-5.1-Codex con el mismo esfuerzo y utiliza un 30 % menos de tokens de pensamiento. Para tareas que no son sensibles a la latencia, OpenAI presenta un nuevo esfuerzo de razonamiento Extra Alto, escrito como xhigh, que permite al modelo pensar más para alcanzar mejores respuestas. Media sigue siendo la configuración recomendada para la mayoría de las cargas de trabajo.
Estos cambios se reflejan en los resultados de las pruebas comparativas. Con GPT-5.1-Codex evaluado con un alto esfuerzo de razonamiento y GPT-5.1-Codex-Max en xhigh, OpenAI informa las siguientes puntuaciones en 500 números de SWE-bench Verified, 73,7 % para GPT-5.1-Codex y 77,9 % para GPT-5.1-Codex-Max. En SWE-Lancer IC SWE, las puntuaciones son 66,3% y 79,9%. En Terminal-Bench 2.0, las puntuaciones son 52,8% y 58,1%. Todas las evaluaciones se ejecutan con la compactación habilitada y Terminal-Bench 2.0 utiliza la CLI del Codex dentro del arnés Harbor del Laude Institute.
En pruebas cualitativas, GPT-5.1-Codex-Max genera diseños de interfaz de alta calidad con funcionalidad y calidad visual similares a GPT-5.1-Codex pero a un costo general de token más bajo, debido a rastreos de razonamiento más eficientes.
Conclusiones clave
GPT 5.1 Codex Max es un modelo de codificación agente de vanguardia construido sobre una base de razonamiento actualizada, más capacitado en tareas reales de ingeniería de software, como creación de relaciones públicas, revisión de código, codificación de interfaz y preguntas y respuestas, y está disponible hoy en Codex CLI, IDE, nube y superficies de revisión de código, con acceso a API próximamente. El modelo introduce soporte nativo para trabajos de larga duración a través de la compactación, donde comprime repetidamente su propio historial para abarcar múltiples ventanas de contexto, lo que permite sesiones de codificación autónomas que pueden continuar durante más de 24 horas en millones de tokens mientras permanecen en una sola tarea. GPT 5.1 Codex Max conserva el control del esfuerzo de razonamiento de GPT 5.1 y, con un esfuerzo medio, supera a GPT 5.1 Codex en el banco SWE verificado mientras utiliza aproximadamente un 30 por ciento menos de tokens de pensamiento, con un modo de razonamiento extra alto para las tareas más difíciles. En los puntos de referencia de codificación de frontera con compactación habilitada, GPT 5.1 Codex Max con alto esfuerzo mejora SWE bench Verified del 73,7 por ciento al 77,9 por ciento, SWE Lancer IC SWE del 66,3 por ciento al 79,9 por ciento y Terminal Bench 2.0 del 52,8 por ciento al 58,1 por ciento, en comparación con GPT 5.1 Codex con alto esfuerzo.
GPT-5.1-Codex-Max es una declaración clara de que OpenAI está redoblando su apuesta por la codificación agente de larga duración en lugar de ediciones breves y de un solo disparo. La compactación, las evaluaciones de codificación de frontera como SWE-bench Verified y SWE-Lancer IC SWE, y los controles de esfuerzo de razonamiento explícito hacen de este modelo un caso de prueba para escalar la computación en tiempo de prueba en flujos de trabajo de ingeniería de software reales, no solo en puntos de referencia. El marco de preparación y el entorno de pruebas del Codex serán fundamentales a medida que esta capacidad pase a los procesos de producción. En general, GPT-5.1-Codex-Max es un modelo de codificación agente de frontera que operacionaliza el razonamiento a largo plazo en herramientas prácticas para desarrolladores.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.
🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.