Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз
Fireworks AI выпустила Fireworks Nexus — слой маршрутизации, который отправляет рутинные задачи кодинга на open-weight модели, а сложные оставляет frontier-провайдеру. По данным компании, это режет расходы в 3–5 раз без изменения Claude Code, Codex и OpenCode. В независимом тесте Faros AI связка на GLM-5.2 обошла Opus 4.8 по качеству и стоила вдвое дешевле.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Fireworks AI a lancé le 28 juillet 2026 Fireworks Nexus, une plateforme de routage et de contrôle des dépenses qui envoie les tâches de codage routinières vers des modèles open-weight et, selon l'éditeur, réduit les coûts de 3 à 5 fois sans changer les outils habituels comme Claude Code.
Pourquoi c'était nécessaire
Les dépenses liées aux agents IA augmentent plus vite que les entreprises ne parviennent à les planifier. Selon Forbes, Uber a épuisé la totalité de son budget IA pour 2026 en seulement quatre mois. Fireworks cite le même rapport : l'adoption des outils agentiques dans les équipes d'ingénierie est passée d'environ un tiers des effectifs à plus de quatre cinquièmes en deux mois, et Claude Code lui-même a atteint environ 5000 ingénieurs après son lancement en décembre 2025.
Fireworks décrit la racine du problème comme une inadéquation, et non une surdépense : la plupart des organisations effectuent un travail routinier à des prix « frontière » parce que la migration vers des modèles open-weight est opérationnellement peu pratique pour les équipes de plateforme.
Comment fonctionne Fireworks Nexus
Fireworks Nexus se compose de trois parties et se connecte par-dessus les outils de développement déjà utilisés. Caractéristiques clés :
- Contrôle et observabilité — budgets au niveau de l'équipe ou de l'entreprise, suivi du ROI par modèle, endpoints hébergés aux États-Unis, rétention zéro des données (zero data retention) et couverture sur 20 centres de données mondiaux.
- FireConnect — installation en une ligne sous licence Apache 2.0 ; il fait correspondre les emplacements de modèles du harness aux modèles Fireworks. Claude Code, Codex et OpenCode continuent de fonctionner sans modification via des API compatibles Anthropic et OpenAI.
- Routage intelligent — un modèle entraîné évalue la complexité de chaque requête : le routinier part vers un modèle open-weight bon marché, les tâches complexes vers votre fournisseur précédent avec votre propre clé (qui, selon Fireworks, n'est pas stockée sur le serveur).
Le routeur est actuellement en statut de research preview. Il route pour l'instant entre Claude Opus 5 et GLM-5.2, donc le chemin pass-through nécessite une clé Anthropic ; la configuration entièrement ouverte route entre Kimi K3 et GLM-5.2.
À quel point est-ce moins cher ?
Les économies constatées dans des tests indépendants se sont révélées notables et ne s'expliquent pas uniquement par la mise en cache. Faros AI a fait tourner 211 tâches d'ingénierie réelles issues de 12 dépôts sur sept combinaisons « modèle+harness ». Claude Code sur GLM-5.2 a obtenu 0,568 selon la grille du modèle-juge, contre 0,521 pour Claude Code sur Opus 4.8 — pour un coût de 0,92 $ contre 1,76 $ par tâche. Le taux de cache s'est élevé à 89,7 % et 99,7 % respectivement.
«
Cette cohorte est spécifique à une entreprise donnée et ne constitue pas un classement universel », prévient Faros AI à l'issue de sa mesure.
Une deuxième étude d'Arize, réalisée avec Fireworks, a couvert 10 modèles sur 40 tâches de Terminal-Bench avec six exécutions chacune, soit 2400 exécutions et 626 $ de dépenses en API. Sur les tâches faciles, la frontière ne procure aucun avantage : Kimi K2.6 a réussi 73 %, GPT-5.5 — 69 %. Sur les tâches difficiles, les modèles les plus performants prennent la tête : GPT-5.5 — 51 %, Kimi K3 — 32 %. Le routage simulé a surpassé toute stratégie à modèle unique : une échelle d'escalade a coûté 0,525 $ par tâche réussie et résolu de façon constante 32,3 tâches sur 40, tandis qu'un GPT-5.5 seul coûtait 0,636 $ et en résolvait 25 sur 40.
Ce que cela signifie
Fireworks Nexus transforme le choix du modèle en un paramètre pilotable : le routinier part vers des moteurs open-weight bon marché, tandis que la frontière coûteuse reste réservée aux tâches véritablement complexes. Les chiffres proviennent du fournisseur et de son programme preview, mais les tests indépendants de Faros AI et d'Arize confirment la thèse centrale : sur une partie des tâches, payer plus cher pour un modèle haut de gamme n'achète pas plus de qualité.
Questions fréquentes
Fireworks Nexus fonctionne-t-il avec Claude Code ?
Oui. Le composant FireConnect s'installe en une seule commande depuis le tableau de bord Fireworks et fait correspondre les emplacements de modèles, de sorte que Claude Code, Codex et OpenCode continuent de fonctionner sans modification via des API compatibles Anthropic et OpenAI.
Dans quelle mesure Fireworks Nexus réduit-il les dépenses ?
Selon Fireworks, la réduction typique est de 3 à 5 fois. Lors des tests avec les équipes de Notion et Doximity, le coût par pull request fusionnée a chuté d'environ un tiers, et le prix moyen du token s'est établi à environ un quart de celui des laboratoires de modèles fermés.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.