OpenAI lanza la API de agentes en versión beta pública, colocando el arnés Codex detrás de una llamada API

OpenAI ha lanzado la API de Agentes en versión beta pública. Ofrece a los desarrolladores las mismas ventajas e infraestructura que ejecutan Codex. OpenAI aloja y mantiene el arnés. Los desarrolladores ejecutan la computación del agente en un entorno limitado administrado por OpenAI, en su propia infraestructura o en un entorno limitado de socios.

¿Es desplegable? Sí. Está disponible para todos los desarrolladores en versión beta pública. Los datos siguen siendo solo para EE. UU. y no se admite la retención cero de datos.

Lo que envió OpenAI

La API de agentes es un servicio administrado basado en el arnés Codex de código abierto. El equipo de OpenAI afirma que la ampliación de Codex y ChatGPT for Work mostró lo que necesitan los agentes de larga duración. Necesitan un arnés que gestione el contexto, utilice herramientas de manera eficiente y coordine a los subagentes. También necesitan una infraestructura que los mantenga funcionando de manera confiable durante días.

Los documentos oficiales organizan la API en torno a 4 conceptos:

Agente: el modelo, instrucciones, herramientas y servidores MCP disponibles para él. Entorno: un entorno limitado opcional donde el agente accede a archivos, carga habilidades y ejecuta comandos. Sesión: una instancia de agente duradera que trabaja en tareas y responde a las entradas. Eventos y elementos: las entradas enviadas al agente y la salida que produce.

Una sesión se ejecuta en 4 pasos. Lo creas y le das una tarea. Luego sigues el progreso a través de streaming o webhooks. Finalmente, continúas con una nueva tarea o diriges el turno actual.

Una llamada API

El anuncio de OpenAI muestra un agente de investigación de incidentes creado en una sola llamada:

importar OpenAI desde “openai”; cliente constante = nuevo OpenAI(); sesión const = await client.beta.agents.sessions.create({ agente: { modelo: “gpt-6-astra”, herramientas: [
{
type: “mcp”,
server_label: “observability”,
transport: {
type: “http”,
server_url: “https://observability.example.com/mcp”,
},
},
]multi_agent: { habilitado: verdadero, max_concurrent_subagents: 3 }, }, vault_ids: [“vault_YOUR_VAULT_ID”]entorno: { tipo: “openai_hosted”, capacit_directorios: [“/workspace/capabilities/skills”]}, input: “Investigar la elevada tasa 5xx de service-api durante los últimos 30 minutos. ” + “Delegar la implementación, el análisis de errores y dependencias a los subagentes. ” + “Guardar los hallazgos, la evidencia y la mitigación recomendada en /workspace/outputs.”, });

El inicio rápido cubre los permisos de las claves API y la configuración del SDK.

Donde corre el agente

La elección del entorno es la principal decisión arquitectónica. La API de agentes admite 3 opciones de zona de pruebas y también puede ejecutarse sin una zona de pruebas.

Sandbox alojado en OpenAI: utiliza la infraestructura de sandboxing detrás de Codex y ChatGPT. Puede configurarlo con archivos, paquetes, habilidades y complementos. Autohospedado: ejecuta el servidor ejecutivo codex dentro de su entorno. Se registra con una clave restringida y se conecta a través de WebSocket. Todas las conexiones son salientes. Sandboxes de socios: Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop y Vercel tienen integraciones de primera clase.

Qué maneja el arnés

OpenAI mantiene el arnés junto con sus modelos, con acceso versionado en cada lanzamiento de modelo.

Sesiones largas: la API compacta automáticamente el contexto anterior a medida que una sesión se acerca a su límite. Los desarrolladores no escriben su propia lógica de compactación. Uso eficiente de herramientas: la búsqueda de herramientas carga definiciones de herramientas solo cuando es necesario. Esto reduce el uso y el costo del token y al mismo tiempo preserva la memoria caché del modelo. Las llamadas a herramientas programáticas permiten a los agentes ejecutar llamadas en paralelo y encadenar operaciones. Los agentes filtran o combinan resultados en código, de modo que solo los datos relevantes regresan al contexto. Las herramientas compatibles incluyen MCP, funciones personalizadas y herramientas integradas como la búsqueda web. Subagentes: con soporte de múltiples agentes, el agente principal divide las tareas complejas en partes independientes. Cada subagente mantiene su propio contexto. El agente principal los coordina y combina los resultados.

API de agentes frente a SDK de agentes frente a API de respuestas

La comparación del tiempo de ejecución de OpenAI posiciona las 3 opciones de esta manera:

API de agentes SDK de agentes API de respuestas Donde se ejecuta el agente Open AI ejecuta un arnés Codex administrado Dentro de su aplicación Su aplicación, con orquestación alojada opcional Esfuerzo de integración Bajo Medio Alto Estado entre tareas Configuración de sesión guardada, turnos y elementos Su almacenamiento y sesiones de SDK Historial manual, encadenamiento de respuestas o conversaciones Entorno de ejecución OpenAI alojado, autohospedado o sin entorno de pruebas Sus proveedores de tiempo de ejecución y entorno de pruebas Su propio entorno

Resultados tempranos del cliente

OpenAI publicó estos números informados por los clientes. Son puntos de referencia proporcionados por los proveedores, no independientes.

Ciridae: la puntuación de evaluación aumentó de 0,71 a 0,85, con una reducción de latencia de 4 veces en los flujos de subagente. SafetyKit: 60% menos de costo por caso después de migrar su flujo de trabajo de revisión de casos. Hifa: 86 % menos de respuestas fallidas de los agentes después de separar el arnés del sandbox. Nash.ai: gestiona miles de agentes de larga trayectoria en redes logísticas globales.

Conclusiones clave

La API de agentes de OpenAI expone el arnés Codex administrado como una API beta pública. Los agentes se ejecutan en entornos sandbox alojados en OpenAI, autohospedados o de 9 socios. La compactación, la búsqueda de herramientas, la llamada de herramientas programáticas y los subagentes están integrados. No hay ningún cargo adicional; usted paga por fichas, herramientas y tiempo del contenedor. Residencia de datos solo en EE. UU. y cargas de trabajo reguladas sin límite ZDR por ahora.

Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150kML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros