Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз
Fireworks AI выпустила Fireworks Nexus — слой маршрутизации, который отправляет рутинные задачи кодинга на open-weight модели, а сложные оставляет frontier-провайдеру. По данным компании, это режет расходы в 3–5 раз без изменения Claude Code, Codex и OpenCode. В независимом тесте Faros AI связка на GLM-5.2 обошла Opus 4.8 по качеству и стоила вдвое дешевле.
Processado por IA de MarkTechPost; editado por Hamidun News
A Fireworks AI lançou em 28 de julho de 2026 o Fireworks Nexus — uma plataforma de roteamento e controle de gastos que direciona tarefas rotineiras de codificação para modelos open-weight e, segundo a desenvolvedora, reduz os custos de 3 a 5 vezes sem mudar as ferramentas já usadas, como o Claude Code.
Por que isso era necessário
Os gastos com agentes de IA estão crescendo mais rápido do que as empresas conseguem planejar. Segundo a Forbes, a Uber esgotou todo o seu orçamento de IA para 2026 em apenas quatro meses. A Fireworks cita o mesmo relatório: a adoção de ferramentas agênticas nas equipes de engenharia cresceu de cerca de um terço dos colaboradores para mais de quatro quintos em dois meses, e o próprio Claude Code atingiu cerca de 5000 engenheiros após seu lançamento em dezembro de 2025.
A Fireworks descreve a raiz do problema como um desalinhamento, e não um gasto excessivo: a maioria das organizações realiza trabalho rotineiro a preços de "fronteira" porque migrar para modelos open-weight é operacionalmente inconveniente para as equipes de plataforma.
Como funciona o Fireworks Nexus
O Fireworks Nexus é composto por três partes e se conecta sobre as ferramentas de desenvolvimento já utilizadas. Principais características:
- Controle e observabilidade — orçamentos em nível de equipe ou empresa, acompanhamento de ROI por modelo, endpoints hospedados nos EUA, retenção zero de dados (zero data retention) e cobertura em 20 data centers globais.
- FireConnect — instalação em uma linha sob licença Apache 2.0; mapeia os slots de modelos no harness para os modelos da Fireworks. Claude Code, Codex e OpenCode continuam funcionando sem alterações via APIs compatíveis com Anthropic e OpenAI.
- Roteamento inteligente — um modelo treinado avalia a complexidade de cada solicitação: tarefas rotineiras vão para um modelo open-weight barato, e tarefas complexas vão para o seu provedor anterior usando sua própria chave (que, segundo a Fireworks, não é armazenada no servidor).
O roteador está atualmente em status de research preview. No momento, ele roteia entre Claude Opus 5 e GLM-5.2, portanto o caminho pass-through requer uma chave da Anthropic; a configuração totalmente aberta roteia entre Kimi K3 e GLM-5.2.
O quanto isso é mais barato?
A economia em testes independentes se mostrou significativa e não é explicada apenas pelo cache. A Faros AI rodou 211 tarefas de engenharia reais de 12 repositórios em sete rotas de "modelo+harness". O Claude Code sobre o GLM-5.2 obteve 0,568 na rubrica do modelo-juiz, contra 0,521 do Claude Code sobre o Opus 4.8 — a um custo de US$ 0,92 contra US$ 1,76 por tarefa. A taxa de acerto de cache foi de 89,7% e 99,7%, respectivamente.
"Essa coorte é específica de uma empresa em particular e não é um ranking universal", alerta a
Faros AI com base em sua medição.
Um segundo estudo da Arize, em conjunto com a Fireworks, abrangeu 10 modelos em 40 tarefas do Terminal-Bench, com seis execuções cada — 2400 execuções e US$ 626 em gastos com API. Em tarefas fáceis, os modelos de fronteira não trazem vantagem: o Kimi K2.6 passou em 73%, o GPT-5.5 em 69%. Em tarefas difíceis, os modelos de ponta lideram: GPT-5.5 com 51%, Kimi K3 com 32%. O roteamento simulado superou qualquer estratégia de modelo único: uma escada de escalonamento custou US$ 0,525 por tarefa bem-sucedida e resolveu de forma consistente 32,3 de 40, enquanto um GPT-5.5 isolado custou US$ 0,636 e resolveu 25 de 40.
O que isso significa
O Fireworks Nexus transforma a escolha do modelo em um parâmetro gerenciável: as tarefas rotineiras vão para motores open-weight baratos, e a fronteira cara fica reservada para tarefas realmente complexas. Os números vêm da fornecedora e de seu programa de preview, mas as execuções independentes da Faros AI e da Arize confirmam a tese central: em parte das tarefas, pagar mais caro por um modelo de ponta não compra mais qualidade.
Perguntas frequentes
O Fireworks Nexus funciona com o Claude Code?
Sim. O componente FireConnect é instalado com um único comando a partir do painel da Fireworks e mapeia os slots de modelos, de forma que Claude Code, Codex e OpenCode continuam funcionando sem alterações via APIs compatíveis com Anthropic e OpenAI.
O quanto o Fireworks Nexus reduz os gastos?
Segundo a Fireworks, a redução típica é de 3 a 5 vezes. Em testes com as equipes da Notion e da Doximity, o custo por pull request mesclado caiu cerca de um terço, e o preço médio do token ficou em torno de um quarto do praticado pelos laboratórios de modelos fechados.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.