Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз
Fireworks AI выпустила Fireworks Nexus — слой маршрутизации, который отправляет рутинные задачи кодинга на open-weight модели, а сложные оставляет frontier-провайдеру. По данным компании, это режет расходы в 3–5 раз без изменения Claude Code, Codex и OpenCode. В независимом тесте Faros AI связка на GLM-5.2 обошла Opus 4.8 по качеству и стоила вдвое дешевле.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Fireworks AI lanzó Fireworks Nexus el 28 de julio de 2026, una plataforma de enrutamiento y control de gastos que dirige las tareas rutinarias de programación hacia modelos open-weight y, según el desarrollador, reduce los costos entre 3 y 5 veces sin cambiar las herramientas habituales como Claude Code.
Por qué era necesario
El gasto en agentes de IA crece más rápido de lo que las empresas logran planificar. Según Forbes, Uber agotó todo su presupuesto de IA para 2026 en solo cuatro meses. Fireworks cita el mismo informe: la adopción de herramientas agénticas en los equipos de ingeniería pasó de aproximadamente un tercio del personal a más de cuatro quintas partes en dos meses, y el propio Claude Code alcanzó cerca de 5000 ingenieros tras su lanzamiento en diciembre de 2025.
Fireworks describe la raíz del problema como un desajuste, no como un sobregasto: la mayoría de las organizaciones realizan trabajo rutinario a precios "de frontera" porque migrar a modelos open-weight resulta operativamente incómodo para los equipos de plataforma.
Cómo funciona Fireworks Nexus
Fireworks Nexus consta de tres componentes y se conecta sobre las herramientas de desarrollo que ya se utilizan. Características clave:
- Control y observabilidad — presupuestos a nivel de equipo o empresa, seguimiento de ROI por modelo, endpoints alojados en EE. UU., retención cero de datos (zero data retention) y cobertura en 20 centros de datos globales.
- FireConnect — instalación de una línea bajo licencia Apache 2.0; hace corresponder las ranuras de modelos del harness con los modelos de Fireworks. Claude Code, Codex y OpenCode siguen funcionando sin cambios a través de las API compatibles con Anthropic y OpenAI.
- Enrutamiento inteligente — un modelo entrenado evalúa la complejidad de cada solicitud: lo rutinario va a un modelo open-weight barato, y las tareas complejas van a su proveedor anterior con su propia clave (que, según Fireworks, no se almacena en el servidor).
El enrutador se encuentra actualmente en estado de research preview. Por ahora enruta entre Claude Opus 5 y GLM-5.2, por lo que la ruta pass-through requiere una clave de Anthropic; la configuración totalmente abierta enruta entre Kimi K3 y GLM-5.2.
¿Cuánto más barato resulta?
El ahorro en pruebas independientes resultó notable y no se explica únicamente por el caché. Faros AI ejecutó 211 tareas de ingeniería reales de 12 repositorios en siete rutas de "modelo+harness". Claude Code sobre GLM-5.2 obtuvo 0,568 según la rúbrica del modelo-juez, frente a 0,521 de Claude Code sobre Opus 4.8, con un costo de $0,92 frente a $1,76 por tarea. La tasa de acierto de caché fue del 89,7% y del 99,7%, respectivamente.
"Esta cohorte es específica de una empresa en particular y no constituye una tabla de clasificación universal", advierte
Faros AI a partir de su medición.
Un segundo estudio de Arize, en conjunto con Fireworks, abarcó 10 modelos en 40 tareas de Terminal-Bench con seis ejecuciones cada una: 2400 ejecuciones y $626 de gasto en API. En tareas fáciles, la frontera no ofrece ventaja: Kimi K2.6 aprobó el 73%, GPT-5.5 el 69%. En tareas difíciles lideran los modelos de gama alta: GPT-5.5 con 51%, Kimi K3 con 32%. El enrutamiento simulado superó a cualquier estrategia de un solo modelo: una escalera de escalado costó $0,525 por tarea exitosa y resolvió de forma constante 32,3 de 40, mientras que un GPT-5.5 solo costó $0,636 y resolvió 25 de 40.
Qué significa esto
Fireworks Nexus convierte la elección del modelo en un parámetro gestionable: lo rutinario va a motores open-weight baratos, y la frontera cara queda reservada para las tareas verdaderamente complejas. Las cifras provienen del proveedor y de su programa preview, pero las pruebas independientes de Faros AI y Arize respaldan la tesis principal: en una parte de las tareas, pagar de más por un modelo de primera línea no compra más calidad.
Preguntas frecuentes
¿Funciona Fireworks Nexus con Claude Code?
Sí. El componente FireConnect se instala con un solo comando desde el panel de Fireworks y hace corresponder las ranuras de modelos, de modo que Claude Code, Codex y OpenCode siguen funcionando sin cambios a través de las API compatibles con Anthropic y OpenAI.
¿Cuánto reduce los costos Fireworks Nexus?
Según Fireworks, la reducción típica es de 3 a 5 veces. En pruebas con los equipos de Notion y Doximity, el costo por pull request fusionado cayó aproximadamente un tercio, y el precio promedio por token resultó ser alrededor de una cuarta parte del de los laboratorios de modelos cerrados.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.