MarkTechPost→ original

Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз

Fireworks AI выпустила Fireworks Nexus — слой маршрутизации, который отправляет рутинные задачи кодинга на open-weight модели, а сложные оставляет frontier-провайдеру. По данным компании, это режет расходы в 3–5 раз без изменения Claude Code, Codex и OpenCode. В независимом тесте Faros AI связка на GLM-5.2 обошла Opus 4.8 по качеству и стоила вдвое дешевле.

Processado por IA de MarkTechPost; editado por Hamidun News
Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A Fireworks AI lançou em 28 de julho de 2026 o Fireworks Nexus — uma plataforma de roteamento e controle de gastos que direciona tarefas rotineiras de codificação para modelos open-weight e, segundo a desenvolvedora, reduz os custos de 3 a 5 vezes sem mudar as ferramentas já usadas, como o Claude Code.

Por que isso era necessário

Os gastos com agentes de IA estão crescendo mais rápido do que as empresas conseguem planejar. Segundo a Forbes, a Uber esgotou todo o seu orçamento de IA para 2026 em apenas quatro meses. A Fireworks cita o mesmo relatório: a adoção de ferramentas agênticas nas equipes de engenharia cresceu de cerca de um terço dos colaboradores para mais de quatro quintos em dois meses, e o próprio Claude Code atingiu cerca de 5000 engenheiros após seu lançamento em dezembro de 2025.

A Fireworks descreve a raiz do problema como um desalinhamento, e não um gasto excessivo: a maioria das organizações realiza trabalho rotineiro a preços de "fronteira" porque migrar para modelos open-weight é operacionalmente inconveniente para as equipes de plataforma.

Como funciona o Fireworks Nexus

O Fireworks Nexus é composto por três partes e se conecta sobre as ferramentas de desenvolvimento já utilizadas. Principais características:

  • Controle e observabilidade — orçamentos em nível de equipe ou empresa, acompanhamento de ROI por modelo, endpoints hospedados nos EUA, retenção zero de dados (zero data retention) e cobertura em 20 data centers globais.
  • FireConnect — instalação em uma linha sob licença Apache 2.0; mapeia os slots de modelos no harness para os modelos da Fireworks. Claude Code, Codex e OpenCode continuam funcionando sem alterações via APIs compatíveis com Anthropic e OpenAI.
  • Roteamento inteligente — um modelo treinado avalia a complexidade de cada solicitação: tarefas rotineiras vão para um modelo open-weight barato, e tarefas complexas vão para o seu provedor anterior usando sua própria chave (que, segundo a Fireworks, não é armazenada no servidor).

O roteador está atualmente em status de research preview. No momento, ele roteia entre Claude Opus 5 e GLM-5.2, portanto o caminho pass-through requer uma chave da Anthropic; a configuração totalmente aberta roteia entre Kimi K3 e GLM-5.2.

O quanto isso é mais barato?

A economia em testes independentes se mostrou significativa e não é explicada apenas pelo cache. A Faros AI rodou 211 tarefas de engenharia reais de 12 repositórios em sete rotas de "modelo+harness". O Claude Code sobre o GLM-5.2 obteve 0,568 na rubrica do modelo-juiz, contra 0,521 do Claude Code sobre o Opus 4.8 — a um custo de US$ 0,92 contra US$ 1,76 por tarefa. A taxa de acerto de cache foi de 89,7% e 99,7%, respectivamente.

"Essa coorte é específica de uma empresa em particular e não é um ranking universal", alerta a

Faros AI com base em sua medição.

Um segundo estudo da Arize, em conjunto com a Fireworks, abrangeu 10 modelos em 40 tarefas do Terminal-Bench, com seis execuções cada — 2400 execuções e US$ 626 em gastos com API. Em tarefas fáceis, os modelos de fronteira não trazem vantagem: o Kimi K2.6 passou em 73%, o GPT-5.5 em 69%. Em tarefas difíceis, os modelos de ponta lideram: GPT-5.5 com 51%, Kimi K3 com 32%. O roteamento simulado superou qualquer estratégia de modelo único: uma escada de escalonamento custou US$ 0,525 por tarefa bem-sucedida e resolveu de forma consistente 32,3 de 40, enquanto um GPT-5.5 isolado custou US$ 0,636 e resolveu 25 de 40.

O que isso significa

O Fireworks Nexus transforma a escolha do modelo em um parâmetro gerenciável: as tarefas rotineiras vão para motores open-weight baratos, e a fronteira cara fica reservada para tarefas realmente complexas. Os números vêm da fornecedora e de seu programa de preview, mas as execuções independentes da Faros AI e da Arize confirmam a tese central: em parte das tarefas, pagar mais caro por um modelo de ponta não compra mais qualidade.

Perguntas frequentes

O Fireworks Nexus funciona com o Claude Code?

Sim. O componente FireConnect é instalado com um único comando a partir do painel da Fireworks e mapeia os slots de modelos, de forma que Claude Code, Codex e OpenCode continuam funcionando sem alterações via APIs compatíveis com Anthropic e OpenAI.

O quanto o Fireworks Nexus reduz os gastos?

Segundo a Fireworks, a redução típica é de 3 a 5 vezes. Em testes com as equipes da Notion e da Doximity, o custo por pull request mesclado caiu cerca de um terço, e o preço médio do token ficou em torno de um quarto do praticado pelos laboratórios de modelos fechados.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…