Cloudflare ha lanzado Agents SDK v0.5.0 para abordar las limitaciones de las funciones sin servidor sin estado en el desarrollo de IA. En las arquitecturas estándar sin servidor, cada llamada de LLM requiere reconstruir el contexto de la sesión desde cero, lo que aumenta la latencia y el consumo de tokens. La última versión de Agents SDK (Agents SDK v0.5.0) proporciona una capa de ejecución integrada verticalmente donde la computación, el estado y la inferencia coexisten en el borde de la red.
El SDK permite a los desarrolladores crear agentes que mantengan el estado durante períodos prolongados, yendo más allá de los simples ciclos de solicitud-respuesta. Esto se logra a través de dos tecnologías principales: Durable Objects, que proporcionan estado e identidad persistentes, e Infire, un motor de inferencia de Rust personalizado y diseñado para optimizar los recursos de borde. Para los desarrolladores, esta arquitectura elimina la necesidad de administrar conexiones de bases de datos externas o servidores WebSocket para la sincronización del estado.
Gestión del estado a través de objetos duraderos
El SDK de agentes se basa en objetos duraderos (DO) para proporcionar identidad y memoria persistentes para cada instancia de agente. En los modelos tradicionales sin servidor, las funciones no tienen memoria de eventos anteriores a menos que consulten una base de datos externa como RDS o DynamoDB, lo que a menudo agrega entre 50 y 200 ms de latencia.
Un objeto duradero es un microservidor con estado que se ejecuta en la red de Cloudflare con su propio almacenamiento privado. Cuando se crea una instancia de un agente utilizando el SDK de agentes, se le asigna una ID estable. Todas las solicitudes posteriores de ese usuario se enrutan a la misma instancia física, lo que permite al agente mantener su estado en la memoria. Cada agente incluye una base de datos SQLite integrada con un límite de almacenamiento de 1 GB por instancia, lo que permite lecturas y escrituras con latencia cero para el historial de conversaciones y los registros de tareas.
Los objetos duraderos tienen un solo subproceso, lo que simplifica la gestión de la concurrencia. Este diseño garantiza que solo se procese 1 evento a la vez para una instancia de agente específica, lo que elimina las condiciones de carrera. Si un agente recibe varias entradas simultáneamente, se ponen en cola y se procesan de forma atómica, lo que garantiza que el estado permanezca constante durante operaciones complejas.
Infire: Optimización de la inferencia con Rust
Para la capa de inferencia, Cloudflare desarrolló Infire, un motor LLM escrito en Rust que reemplaza pilas basadas en Python como vLLM. Los motores Python a menudo enfrentan cuellos de botella en el rendimiento debido al bloqueo global del intérprete (GIL) y las pausas en la recolección de basura. Infire está diseñado para maximizar la utilización de la GPU en hardware H100 al reducir la sobrecarga de la CPU.
El motor utiliza gráficos CUDA granulares y compilación Just-In-Time (JIT). En lugar de lanzar kernels de GPU de forma secuencial, Infire compila sobre la marcha un gráfico CUDA dedicado para cada tamaño de lote posible. Esto permite al controlador ejecutar el trabajo como una única estructura monolítica, lo que reduce la sobrecarga de la CPU en un 82 %. Los puntos de referencia muestran que Infire es un 7% más rápido que vLLM 0.10.0 en máquinas descargadas, utilizando solo un 25% de CPU en comparación con el >140% de vLLM.
Infire también utiliza Paged KV Caching, que divide la memoria en bloques no contiguos para evitar la fragmentación. Esto permite el “procesamiento por lotes continuo”, donde el motor procesa nuevas indicaciones y al mismo tiempo finaliza las generaciones anteriores sin una caída del rendimiento. Esta arquitectura permite a Cloudflare mantener una tasa de solicitudes cálidas del 99,99% para inferencia.
Modo de código y eficiencia del token
Los agentes de IA estándar suelen utilizar ‘llamadas a herramientas’, donde el LLM genera un objeto JSON para activar una función. Este proceso requiere un intercambio entre el LLM y el entorno de ejecución para cada herramienta utilizada. El ‘Modo de código’ de Cloudflare cambia esto al pedirle al LLM que escriba un programa TypeScript que organice múltiples herramientas a la vez.
Este código se ejecuta en un entorno aislado seguro de V8. Para tareas complejas, como buscar 10 archivos diferentes, el modo de código proporciona una reducción del 87,5 % en el uso de tokens. Debido a que los resultados intermedios permanecen dentro del entorno de pruebas y no se envían de regreso al LLM para cada paso, el proceso es más rápido y rentable.
El modo de código también mejora la seguridad a través de “vinculaciones seguras”. La zona de pruebas no tiene acceso a Internet; solo puede interactuar con servidores Model Context Protocol (MCP) a través de enlaces específicos en el objeto de entorno. Estos enlaces ocultan claves API confidenciales del LLM, lo que evita que el modelo filtre accidentalmente credenciales en su código generado.
Febrero de 2026: lanzamiento v0.5.0
El SDK de agentes alcanzó la versión 0.5.0. Esta versión introdujo varias utilidades para agentes listos para producción:
this.retry(): un nuevo método para reintentar operaciones asincrónicas con retroceso exponencial y fluctuación. Supresión de protocolo: los desarrolladores ahora pueden suprimir los marcos de texto JSON por conexión utilizando el enlace shouldSendProtocolMessages. Esto es útil para clientes IoT o MQTT que no pueden procesar datos JSON. Chat AI estable: el paquete @cloudflare/ai-chat alcanzó la versión 0.1.0, agregando persistencia de mensajes a SQLite y un “Guarda de tamaño de fila” que realiza una compactación automática cuando los mensajes se acercan al límite de SQLite de 2 MB.
Conclusiones clave
Persistencia con estado en el borde: a diferencia de las funciones tradicionales sin estado y sin servidor, el SDK de agentes utiliza objetos duraderos para proporcionar a los agentes una identidad y memoria permanentes. Esto permite que cada agente mantenga su propio estado en una base de datos SQLite integrada con 1 GB de almacenamiento, lo que permite el acceso a datos con latencia cero sin llamadas a bases de datos externas. Inferencia de óxido de alta eficiencia: el motor de inferencia Infire de Cloudflare, escrito en Rust, optimiza la utilización de la GPU mediante el uso de gráficos CUDA granulares para reducir la sobrecarga de la CPU en un 82 %. Los puntos de referencia muestran que es un 7% más rápido que vLLM 0.10.0 basado en Python y utiliza Paged KV Caching para mantener una tasa de solicitudes en caliente del 99,99%, lo que reduce significativamente las latencias de arranque en frío. Optimización de tokens a través del modo de código: el ‘modo de código’ permite a los agentes escribir y ejecutar programas TypeScript en un aislamiento V8 seguro en lugar de realizar múltiples llamadas a herramientas individuales. Este enfoque determinista reduce el consumo de tokens en un 87,5 % para tareas complejas y mantiene los datos intermedios dentro del sandbox para mejorar tanto la velocidad como la seguridad. Integración de herramientas universales: la plataforma es totalmente compatible con el Protocolo de contexto modelo (MCP), un estándar que actúa como traductor universal para herramientas de inteligencia artificial. Cloudflare ha implementado 13 servidores MCP oficiales que permiten a los agentes administrar de forma segura componentes de infraestructura como DNS, almacenamiento R2 y Workers KV a través de comandos de lenguaje natural. Utilidades listas para producción (v0.5.0): la versión de febrero de 2026 introdujo características de confiabilidad críticas, incluida una utilidad this.retry() para operaciones asincrónicas con retroceso y fluctuación exponencial. También agregó supresión de protocolo, que permite a los agentes comunicarse con dispositivos IoT solo binarios y sistemas integrados livianos que no pueden procesar marcos de texto JSON estándar.
Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.