MarkTechPost→ оригинал

Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз

Fireworks AI выпустила Fireworks Nexus — слой маршрутизации, который отправляет рутинные задачи кодинга на open-weight модели, а сложные оставляет frontier-провайдеру. По данным компании, это режет расходы в 3–5 раз без изменения Claude Code, Codex и OpenCode. В независимом тесте Faros AI связка на GLM-5.2 обошла Opus 4.8 по качеству и стоила вдвое дешевле.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Fireworks Nexus: маршрутизация кода в open-weight модели и снижение AI-расходов в 3–5 раз
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Компания Fireworks AI 28 июля 2026 года выпустила Fireworks Nexus — платформу маршрутизации и контроля расходов, которая направляет рутинные задачи кодинга на open-weight модели и, по заявлению разработчика, снижает стоимость в 3–5 раз, не меняя привычные инструменты вроде Claude Code.

Зачем это понадобилось

Расходы на AI-агентов растут быстрее, чем компании успевают их планировать. По данным Forbes, Uber исчерпал весь свой бюджет на AI за 2026 год всего за четыре месяца. Fireworks ссылается на тот же отчёт: внедрение агентных инструментов в инженерных командах выросло примерно с трети сотрудников до более чем четырёх пятых за два месяца, а сам Claude Code после запуска в декабре 2025 года охватил около 5 000 инженеров.

Fireworks описывает корень проблемы как несоответствие, а не перерасход: большинство организаций выполняют рутинную работу по «фронтирным» ценам, потому что переход на open-weight модели операционно неудобен для платформенных команд.

Как устроен Fireworks Nexus

Fireworks Nexus состоит из трёх частей и подключается поверх уже используемых инструментов разработки. Ключевые характеристики:

  • Контроль и наблюдаемость — бюджеты на уровне команды или компании, отслеживание ROI по моделям, US-hosted эндпоинты, нулевое хранение данных (zero data retention) и покрытие 20 глобальных дата-центров.
  • FireConnect — установка в одну строку под лицензией Apache 2.0; сопоставляет слоты моделей в harness с моделями Fireworks. Claude Code, Codex и OpenCode продолжают работать без изменений через Anthropic- и OpenAI-совместимые API.
  • Умная маршрутизация — обученная модель оценивает сложность каждого запроса: рутина уходит на дешёвую open-weight модель, сложные задачи — на ваш прежний провайдер по вашему ключу (который, по словам Fireworks, не хранится на сервере).

Роутер пока в статусе research preview. Сейчас он маршрутизирует между Claude Opus 5 и GLM-5.2, поэтому pass-through-путь требует ключа Anthropic; полностью открытая конфигурация роутит между Kimi K3 и GLM-5.2.

Насколько это дешевле?

Экономия в независимых тестах оказалась заметной и не объясняется одним лишь кэшированием. Faros AI прогнала 211 реальных инженерных задач из 12 репозиториев по семи маршрутам «модель + harness». Claude Code на GLM-5.2 набрал 0,568 по модельному судье-рубрике против 0,521 у Claude Code на Opus 4.8 — при стоимости $0,92 против $1,76 за задачу. Доля кэша составила 89,7% и 99,7% соответственно.

«Эта когорта специфична для конкретной компании и не является универсальным лидербордом», — предупреждает

Faros AI по итогам своего замера.

Второе исследование Arize совместно с Fireworks охватило 10 моделей на 40 задачах Terminal-Bench по шесть прогонов — 2 400 запусков и $626 расходов на API. На лёгких задачах фронтир не даёт преимущества: Kimi K2.6 прошёл 73%, GPT-5.5 — 69%. На сложных лидируют топовые модели: GPT-5.5 — 51%, Kimi K3 — 32%. Симулированная маршрутизация обошла любую одномодельную стратегию: лестница эскалации дала $0,525 за успешную задачу и стабильно решала 32,3 из 40, тогда как один GPT-5.5 стоил $0,636 и решал 25 из 40.

Что это значит

Fireworks Nexus превращает выбор модели в управляемый параметр: рутина уходит на дешёвые open-weight движки, а дорогой фронтир остаётся для действительно сложных задач. Цифры — от вендора и из preview-программы, но независимые прогоны Faros AI и Arize подтверждают главный тезис: на части задач переплата за топовую модель не покупает качества.

Частые вопросы

Работает ли Fireworks Nexus с Claude Code?

Да. Компонент FireConnect ставится одной командой из панели Fireworks и сопоставляет слоты моделей, так что Claude Code, Codex и OpenCode продолжают работать без изменений через Anthropic- и OpenAI-совместимые API.

Насколько Fireworks Nexus снижает расходы?

По данным Fireworks, типичное сокращение — в 3–5 раз. На тестах с командами Notion и Doximity стоимость одного смёрдженного pull request упала примерно на треть, а усреднённая цена токена оказалась около четверти от закрытых модельных лабораторий.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…