arXiv cs.AI→ оригинал

Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency

Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи в июле 2026 года опубликовали на arXiv статью о latency-aware роутере LLM-запросов, который совместно оптимизирует задержку, точность и стоимость и даёт до 40% прироста accuracy-cost utility при тех же задержках, что и стандартная балансировка нагрузки.

Что не так с текущими роутерами

Современные роутеры LLM-запросов балансируют только качество ответа и денежную стоимость, но не учитывают задержку генерации на конкретном инстансе модели. На практике латентностью управляют отдельные политики балансировки нагрузки — round-robin или join-the-shortest-queue, — и они игнорируют и точность модели, и стоимость инференса. В итоге маршрутизация и распределение нагрузки работают вслепую друг относительно друга.

  • Задача — совместно оптимизировать три параметра: latency, accuracy и cost
  • Базовые политики балансировки: round-robin, join-the-shortest-queue
  • Прирост accuracy-cost utility — до 40%
  • Задержки при этом остаются на уровне стандартных подходов
  • Источник — препринт arXiv (раздел cs.AI), июль 2026 года

Как оценивают задержку запроса

Авторы построили lightweight-оценщик, который симулирует авторегрессионную batch-обработку токенов в serving-фреймворке и предсказывает TTFT (time-to-first-token) для каждого запроса. Сложность в том, что задержка зависит не только от длины промпта: на неё влияют текущая prefill- и decode-нагрузка на инстансе модели, а также политика шедулинга и батчинга самого фреймворка. Оценщик учитывает все эти факторы и остаётся достаточно дешёвым, чтобы работать в реальном времени при маршрутизации.

Почему это важно

Latency-aware роутер встраивает оценку задержки прямо в решение о маршрутизации и распределяет запросы по инстансам так, чтобы одновременно держать под контролем задержку, точность и стоимость. По данным авторов, такая совместная оптимизация повышает accuracy-cost utility до 40%, не ухудшая latency по сравнению с обычной балансировкой нагрузки.

«Совместная оптимизация даёт до 40% прироста accuracy-cost utility при

сохранении тех же задержек, что и у стандартных подходов балансировки нагрузки», — говорится в аннотации работы на arXiv.

Для сервисов, которые раздают ответы десятков моделей под нагрузкой, это способ выжать больше качества на каждый вложенный доллар, не заставляя пользователя ждать дольше.

Что это значит

Маршрутизация LLM-запросов перестаёт быть выбором «дешевле или точнее» и добавляет третью ось — скорость. Инфраструктурным командам это даёт рычаг: тот же парк моделей отдаёт больше пользы без роста задержек и без переплаты за инференс.

Частые вопросы

Что такое TTFT (time-to-first-token)?

TTFT — это время до первого токена ответа, ключевая метрика задержки в LLM-сервисах. Оценщик из статьи предсказывает TTFT для каждого запроса, симулируя batch-обработку токенов в serving-фреймворке.

Насколько latency-aware роутинг эффективнее обычной балансировки?

По данным авторов, совместная оптимизация задержки, точности и стоимости повышает accuracy-cost utility до 40% при тех же задержках, что и у round-robin или join-the-shortest-queue.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…