Fireworks AI ha lanzado Fireworks Nexus, una plataforma de enrutamiento y gestión de IA dirigida a organizaciones de ingeniería. Conecta las herramientas de codificación que los desarrolladores ya utilizan con una capa administrada de modelos abiertos.
El problema al que se dirige está bien documentado. Forbes informó que Uber agotó todo su presupuesto de IA para 2026 en cuatro meses. Claude Code había llegado a aproximadamente 5.000 ingenieros después de su lanzamiento en diciembre. Fireworks cita el mismo informe y señala que la adopción de agentes aumentó de aproximadamente un tercio de los ingenieros a más de cuatro quintos en dos meses.
Fireworks enmarca el problema subyacente como un desajuste, no como un gasto excesivo. La mayoría de las organizaciones realizan trabajos rutinarios a precios de frontera. La complejidad operativa ha hecho que el cambio a modelos abiertos sea poco atractivo para los equipos de plataforma.
Nexo de fuegos artificiales
Nexus se compone de tres componentes:
1. Controles empresariales y observabilidad de costos: los equipos establecen presupuestos a nivel de equipo o empresa. Realizan un seguimiento del retorno de la inversión (ROI) en todos los modelos y herramientas, y aplican políticas desde un solo lugar. Las solicitudes se ejecutan en la plataforma de inferencia de producción de Fireworks, con puntos finales alojados en EE. UU., retención de datos cero y cobertura en 20 centros de datos globales.
2. Continuidad del flujo de trabajo: FireConnect es una instalación de una línea que asigna ranuras de modelos de arnés a modelos de Fireworks. Se lanza bajo Apache 2.0 y se puede instalar desde Fireworks Dashboard con un solo comando. Claude Code, Codex y OpenCode siguen funcionando sin cambios. FireConnect se ejecuta en las API de Fireworks Serverless que son compatibles con Anthropic y OpenAI, por lo que la mayoría de las herramientas se conectan con una URL base y un ID de modelo.
3. Gestión inteligente del tráfico: un modelo entrenado personalizado puntúa la dificultad de cada solicitud. Las solicitudes de rutina se dirigen a un modelo rentable y de peso abierto atendido por Fireworks. Las solicitudes difíciles pasan a su proveedor actual mediante su propia clave, que según Fireworks nunca se almacena en el lado del servidor. El equipo de investigación informa que esto normalmente genera una reducción de costos de 3 a 5 veces.
Una nota importante para cualquiera que esté planeando una implementación. El enrutador es una vista previa de la investigación. Actualmente realiza una ruta entre Claude Opus 5 y GLM-5.2, por lo que el camino de paso requiere una clave antrópica. En su lugar, una configuración totalmente abierta conecta entre Kimi K3 y GLM-5.2.
Tres partes. Seleccione uno para ampliar el detalle.
‘; h+=’
Las descripciones de los componentes siguen al anuncio de Fireworks Nexus del 26 de julio de 2026. El enrutador es una vista previa de la investigación.
‘; fuera.innerHTML=h; pintarDetalle(0); root.querySelectorAll(‘.box’).forEach(function(b){ var go=function(){ root.querySelectorAll(‘.box’).forEach(function(x){x.classList.remove(‘on’);}); b.classList.add(‘on’); paintDetail(+b.getAttribute(‘data-i’)); }; b.addEventListener(‘click’,go); b.addEventListener(‘keydown’,function(e){if(e.key===’Enter’||e.key===’ ‘){e.preventDefault();go();}}); } función paintDetail(i){ var s=pila[i],d=document.getElementById(‘mtpnx-det’); d.innerHTML=’▸ ‘+st+’‘; tamaño(); } función renderArize(){ var max=1.233; var filas=arize.slice().sort(función(a,b){ var x=a[sortKey],y=b[sortKey]; if(typeof x===’string’){return sortAsc?x.localeCompare(y):y.localeCompare(x);} return sortAsc?xy:yx; }); varh=”
Costo por tarea exitosa: 2400 ejecuciones
“;h+=’
40 tareas Terminal-Bench, 10 modelos, 6 pruebas cada uno. Haga clic en una columna para volver a ordenarla.
‘; h+=’
Costo por tarea exitosa = todo el gasto en cada intento, dividido por las tareas completadas. Las filas resaltadas son modelos de peso abierto ofrecidos por Fireworks. Precios a julio de 2026; las tasas de aprobación tienen aproximadamente un intervalo de confianza del 95% de ±6 puntos.
‘; fuera.innerHTML=h; out.querySelectorAll(‘th[data-k]’).forEach(function(th){ th.addEventListener(‘click’,function(){ var k=th.getAttribute(‘data-k’); if(k===sortKey){sortAsc=!sortAsc;}else{sortKey=k;sortAsc=(k!==’pass’);} renderArize(); }); }); tamaño(); } función renderDiff(){ var h=”
Adónde va realmente la prima de frontera
Tasa de aprobación dividida por dificultad de la tarea. Mismas carreras, diferente pregunta.
‘; h+=’
En tareas sencillas los modelos baratos son competitivos: Kimi K2.6 supera el 73% mientras que GPT-5.5 supera el 69%. En tareas difíciles sólo el nivel superior resiste. Esa brecha es el argumento principal para enrutar por dificultad en lugar de comprar un modelo para cada trabajo.
‘; fuera.innerHTML=h; tamaño(); } función renderFaros(){ var maxc=2.06; varh=”
211 tareas de ingeniería reales, 7 rutas de modelismo y arneses
“;h+=’
Faros AI reprodujo solicitudes de extracción históricas en 12 repositorios. La puntuación del juez es una rúbrica basada en modelos.
‘; h+=’
Claude Code en GLM-5.2 obtuvo una puntuación de 0,568 frente a 0,521 de Claude Code en Opus 4.8, a 0,92 dólares por tarea frente a 1,76 dólares. El porcentaje de caché fue casi idéntico entre las dos rutas principales, por lo que la diferencia de costos no es un artefacto del almacenamiento en caché. Los resultados son específicos de una cohorte, no una tabla de clasificación universal.
‘; fuera.innerHTML=h; tamaño(); } función renderRoute(){ var pol=[
{n:’gpt-oss-120b alone’,s:’8 / 40′,c:0.054},
{n:’GPT-5.5 alone (best single model)’,s:’25 / 40′,c:0.636},
{n:’Oracle routing (ceiling, needs hindsight)’,s:’34 / 40′,c:0.228},
{n:’Escalation ladder (deployable)’,s:’32.3 / 40′,c:0.525},
{n:’Naive escalation through all 10 models’,s:’34.5 / 40′,c:1.319}
]; varh=”
Políticas de enrutamiento medidas
Simulado sobre las mismas 2.400 carreras reales. La cobertura cuenta las tareas resueltas en al menos 4 de 6 intentos.
‘; h+=’
Combinación ilustrativa: arrastre para establecer la proporción de trabajo manejada por el escalón económico
‘+ ‘
baratofrontera
‘+ ‘
frente a GPT-5.5 solo
2,8× más bajo
‘+ ‘
‘; h+=’
El control deslizante es una combinación lineal de dos puntos finales medidos, $0,054 para gpt-oss-120b y $0,636 para GPT-5.5. Es una ilustración de la aritmética, no un resultado medido, e ignora la cobertura: el modelo barato resuelve de forma fiable sólo 8 de 40 tareas por sí solo. Fireworks cotiza una reducción de costos de 3 a 5 veces para su propio enrutador, que se encuentra en la fase preliminar de la investigación.
‘; fuera.innerHTML=h; var sl=document.getElementById(‘mtpnx-sl’); función upd(){ var f=+sl.value/100, c=0.054*f+0.636*(1-f); document.getElementById(‘mtpnx-share’).textContent=sl.value+’%’; document.getElementById(‘mtpnx-cost’).textContent=”$”+c.toFixed(3); document.getElementById(‘mtpnx-save’).textContent=(0.636/c).toFixed(1)+’\u00d7 lower’; } sl.addEventListener(‘entrada’,upd); actualizar(); tamaño(); } var vistas={stack:renderStack,arize:renderArize,diff:renderDiff,faros:renderFaros,route:renderRoute}; tabs.forEach(function
Actuación
El equipo de investigación de Fireworks ha estado probando Nexus con equipos de desarrollo, incluidos Notion y Doximity. Los resultados preliminares muestran una reducción de un tercio en el costo por solicitud de extracción fusionada. El equipo de investigación también informa una tasa de token combinado de aproximadamente una cuarta parte de los laboratorios modelo cerrados. Estas son cifras de proveedores de un programa de vista previa y deben leerse de esa manera.
La evidencia más útil proviene de dos evaluaciones independientes que cita Fireworks.
Faros AI ejecutó 211 tareas de ingeniería reales extraídas de 12 repositorios en siete rutas de modelado y aprovechamiento. Claude Code en GLM-5.2 obtuvo una puntuación de 0,568 en un juez de rúbrica basada en modelos. Claude Code en Opus 4.8 obtuvo una puntuación de 0,521. La diferencia de costes era mayor que la diferencia de calidad: 0,92 dólares por tarea frente a 1,76 dólares. El porcentaje de caché fue del 89,7 % y 99,7 % respectivamente, por lo que el almacenamiento en caché no explica el resultado. Faros enfatiza que la cohorte es específica de la empresa y no una tabla de clasificación universal.
Arize, en un estudio conjunto con Fireworks, evaluó 10 modelos en 40 tareas de Terminal-Bench en seis pruebas cada una. Esto supone 2.400 ejecuciones y 626 dólares de gasto en API, calificados por el propio conjunto de pruebas de cada tarea. La métrica principal es el costo por tarea exitosa, que cuenta cada intento fallido y reintento.
Dos hallazgos de ese estudio guardan relación directa con el diseño del Nexus. En tareas fáciles, la prima de frontera no compra nada: Kimi K2.6 superó el 73% mientras que GPT-5.5 superó el 69%. En tareas difíciles sólo compite el nivel superior, con GPT-5.5 con un 51% y Kimi K3 con un 32%. El arnés de evaluación de Arize es de código abierto, por lo que los equipos pueden volver a ejecutarlo en sus propias cargas de trabajo.
El enrutamiento simulado sobre esas ejecuciones superó todas las estrategias de un solo modelo. Una escalera de escalada deliberada alcanzó 0,525 dólares por tarea exitosa y resolvió de manera confiable 32,3 de 40 tareas. Solo GPT-5.5 costó $0,636 y resolvió de manera confiable 25 de 40. La escalada ingenua a través de los diez modelos costó $1,319, peor que cualquier modelo probado. El diseño de escaleras no es opcional.
Cómo lo activan realmente los equipos
Hay tres caminos prácticos y tienen diferentes radios de explosión.
La ruta FireConnect es la de menor fricción. El instalador requiere que la CLI de Claude Code ya esté en PATH, solicita una vez una clave API de Fireworks, registra un mercado de complementos y escribe la configuración de Claude Code con una copia de seguridad con marca de tiempo. Expone /fireconnect:on, /fireconnect:off, /fireconnect:setup, /fireconnect:models y /fireconnect:set-models.
La segunda ruta omite el complemento por completo. Configure ANTHROPIC_BASE_URL y una clave de Fireworks, o utilice el cliente compatible con OpenAI con una URL base y un ID de modelo modificados. Arize notó que agregar un modelo a su arnés era una línea de configuración. Esa intercambiabilidad es lo que hace que una escalera de escalada sea edificable.
El tercer camino es el enrutador mismo, que se encuentra frente a un contrato fronterizo existente.