OpenAI publica una vista previa de la investigación de GPT‑5.3-Codex-Spark: un modelo de codificación de IA 15 veces más rápido que ofrece más de 1000 tokens por segundo en hardware de Cerebras

OpenAI acaba de lanzar una nueva vista previa de investigación llamada GPT-5.3 Codex-Spark. Este modelo está diseñado para una cosa: velocidad extrema. Mientras que el Codex GPT-5.3 estándar se centra en el razonamiento profundo, Spark está diseñado para tiempos de respuesta casi instantáneos. Es el resultado de una profunda integración de hardware y software entre OpenAI y Cerebras.

Los resultados cambian las reglas del juego. Spark es 15 veces más rápido que el buque insignia GPT-5.3 Codex. Entrega constantemente más de 1000 tokens por segundo. Esta velocidad elimina efectivamente el retraso entre el pensamiento de un desarrollador y la salida del código del modelo.

El hardware: ingeniería a escala de oblea

El enorme salto de rendimiento está impulsado por Cerebras Wafer-Scale Engine 3 (WSE-3). Los modelos de IA tradicionales se ejecutan en grupos de pequeñas GPU. Estas GPU deben comunicarse entre sí a través de cables, lo que crea un “cuello de botella”. Este cuello de botella ralentiza la velocidad del modelo.

El WSE-3 es diferente. Es un chip único y gigante del tamaño de una oblea de silicio entera. Debido a que todo el modelo se basa en una pieza de silicio, no hay cables que lo ralenticen. Esta arquitectura proporciona:

Memoria masiva en chip. Ancho de banda ultraalto. Computación de baja latencia.

Al utilizar el sistema Cerebras CS-3, OpenAI puede ejecutar inferencias a velocidades que los clústeres de GPU tradicionales no pueden alcanzar.

Optimizaciones de software y baja latencia

La velocidad no se trata sólo del chip. OpenAI rediseñó la forma en que el modelo se comunica con su computadora. Se alejaron de los métodos de solicitud tradicionales e introdujeron una conexión WebSocket persistente.

Este cambio conlleva varias mejoras técnicas:

Tiempo de ida y vuelta (RTT): la sobrecarga cliente-servidor se reduce en un 80 %. Tiempo hasta el primer token (TTFT): esto se mejora en un 50%, lo que significa que el código comienza a aparecer casi en el momento en que presionas Enter. Gastos generales por token: el tiempo de procesamiento interno por token se reduce en un 30 %.

Estas optimizaciones permiten la “dirección en tiempo real”. Puede interrumpir el modelo mientras escribe y redirigir su lógica sin esperar a que finalice el bloque completo.

Las compensaciones: velocidad versus razonamiento

GPT-5.3 Codex-Spark está optimizado para el rendimiento, no para una gran complejidad. Es un modelo “más pequeño” que el buque insignia GPT-5.3 Codex. Debido a esto, tiene menor profundidad de razonamiento.

https://openai.com/index/introduciendo-gpt-5-3-codex-spark/
https://openai.com/index/introduciendo-gpt-5-3-codex-spark/

Los desarrolladores deben tener en cuenta estas diferencias de rendimiento:

Puntos de referencia: Spark obtiene puntuaciones más bajas en SWE-Bench Pro y Terminal-Bench 2.0 en comparación con el modelo insignia. Puede tener problemas con cambios de arquitectura de múltiples archivos muy complejos. Seguridad: según el marco de preparación de OpenAI, el buque insignia GPT-5.3 Codex está clasificado como de capacidad “alta” para la ciberseguridad. Spark no alcanza este alto umbral. No debe utilizarse para lógica de seguridad sensible o tareas de autenticación autónoma.

Especificaciones rápidas y acceso

Spark ya está disponible para usuarios y desarrolladores de ChatGPT Pro. Puedes acceder a él a través de las siguientes herramientas:

Aplicación Codex: use el selector de modelo para seleccionar ‘Spark’. Extensión VS Code: Integrada directamente en el compositor. CLI: acceda a él mediante el comando codex –model gpt-5.3-codex-spark.

CaracterísticaGPT-5.3 Codex-SparkGPT-5.3 Codex (buque insignia)Tokens por segundo1000+~70Ventana de contexto128k128kHardwareCerebras WSE-3Clústeres de GPU NVIDIAMejor paraIteración rápidaRazonamiento profundo/seguridad

Conclusiones clave

Gran velocidad: Spark es 15 veces más rápido que el buque insignia GPT-5.3 Codex y ofrece un rendimiento sin precedentes de más de 1000 tokens por segundo para permitir la generación de código casi instantánea. Infraestructura de silicio personalizada: este es el primer modelo de OpenAI que se ejecuta en hardware Cerebras Wafer-Scale Engine 3 (WSE-3) en lugar de las GPU NVIDIA tradicionales, y utiliza memoria de ‘escala de oblea’ para eliminar los cuellos de botella de datos. Reducción drástica de la latencia: la integración de una conexión WebSocket persistente reduce la sobrecarga del viaje de ida y vuelta cliente-servidor en un 80 % y mejora el tiempo hasta el primer token en un 50 %. Dirección en tiempo real: Diseñado para ‘microiteraciones’, la velocidad del modelo permite a los desarrolladores interrumpir y redirigir la lógica en tiempo real, cambiando el flujo de trabajo del procesamiento por lotes a la programación en pares en vivo. Compensaciones de capacidad específicas: si bien es más rápido, Spark tiene una profundidad de razonamiento más baja que el modelo insignia y no cumple con el umbral de “alta capacidad” para ciberseguridad en el marco de preparación de OpenAI, lo que lo hace inadecuado para tareas de seguridad o autenticación sensibles.

Consulta los detalles técnicos aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.