Fireworks AI lanza Fireworks Nexus: una capa de enrutamiento directo y control de costos que traslada el trabajo de codificación de rutina a modelos abiertos

Fireworks AI ha lanzado Fireworks Nexus, una plataforma de enrutamiento y gestión de IA dirigida a organizaciones de ingeniería. Conecta las herramientas de codificación que los desarrolladores ya utilizan con una capa administrada de modelos abiertos.

El problema al que se dirige está bien documentado. Forbes informó que Uber agotó todo su presupuesto de IA para 2026 en cuatro meses. Claude Code había llegado a aproximadamente 5.000 ingenieros después de su lanzamiento en diciembre. Fireworks cita el mismo informe y señala que la adopción de agentes aumentó de aproximadamente un tercio de los ingenieros a más de cuatro quintos en dos meses.

Fireworks enmarca el problema subyacente como un desajuste, no como un gasto excesivo. La mayoría de las organizaciones realizan trabajos rutinarios a precios de frontera. La complejidad operativa ha hecho que el cambio a modelos abiertos sea poco atractivo para los equipos de plataforma.

Nexo de fuegos artificiales

Nexus se compone de tres componentes:

1. Controles empresariales y observabilidad de costos: los equipos establecen presupuestos a nivel de equipo o empresa. Realizan un seguimiento del retorno de la inversión (ROI) en todos los modelos y herramientas, y aplican políticas desde un solo lugar. Las solicitudes se ejecutan en la plataforma de inferencia de producción de Fireworks, con puntos finales alojados en EE. UU., retención de datos cero y cobertura en 20 centros de datos globales.

2. Continuidad del flujo de trabajo: FireConnect es una instalación de una línea que asigna ranuras de modelos de arnés a modelos de Fireworks. Se lanza bajo Apache 2.0 y se puede instalar desde Fireworks Dashboard con un solo comando. Claude Code, Codex y OpenCode siguen funcionando sin cambios. FireConnect se ejecuta en las API de Fireworks Serverless que son compatibles con Anthropic y OpenAI, por lo que la mayoría de las herramientas se conectan con una URL base y un ID de modelo.

3. Gestión inteligente del tráfico: un modelo entrenado personalizado puntúa la dificultad de cada solicitud. Las solicitudes de rutina se dirigen a un modelo rentable y de peso abierto atendido por Fireworks. Las solicitudes difíciles pasan a su proveedor actual mediante su propia clave, que según Fireworks nunca se almacena en el lado del servidor. El equipo de investigación informa que esto normalmente genera una reducción de costos de 3 a 5 veces.

Una nota importante para cualquiera que esté planeando una implementación. El enrutador es una vista previa de la investigación. Actualmente realiza una ruta entre Claude Opus 5 y GLM-5.2, por lo que el camino de paso requiere una clave antrópica. En su lugar, una configuración totalmente abierta conecta entre Kimi K3 y GLM-5.2.