arXiv cs.AI→ original

Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency

Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.

Processado por IA de arXiv cs.AI; editado por Hamidun News
Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores publicaram no arXiv um artigo sobre um roteador de requisições LLM com consciência de latência (latency-aware) que otimiza conjuntamente latência, precisão e custo, entregando até 40% de ganho em accuracy-cost utility com a mesma latência do balanceamento de carga padrão.

O que há de errado com os roteadores atuais

Os roteadores de requisições LLM atuais equilibram apenas a qualidade da resposta e o custo monetário, mas não levam em conta a latência de geração em uma instância específica do modelo. Na prática, a latência é gerenciada por políticas de balanceamento de carga separadas — round-robin ou join-the-shortest-queue —, que ignoram tanto a precisão do modelo quanto o custo de inferência. Como resultado, o roteamento e a distribuição de carga funcionam às cegas um em relação ao outro.

  • O objetivo é otimizar conjuntamente três parâmetros: latency, accuracy e cost
  • Políticas básicas de balanceamento: round-robin, join-the-shortest-queue
  • Ganho em accuracy-cost utility: até 40%
  • A latência permanece no nível das abordagens padrão
  • Fonte: preprint no arXiv (seção cs.AI), julho de 2026

Como a latência da requisição é estimada

Os autores construíram um estimador leve (lightweight) que simula o processamento em lote (batch) autorregressivo de tokens em um serving framework e prevê o TTFT (time-to-first-token) para cada requisição. A dificuldade é que a latência não depende apenas do comprimento do prompt: ela também é afetada pela carga atual de prefill e decode na instância do modelo, além da política de scheduling e batching do próprio framework. O estimador leva em conta todos esses fatores e permanece barato o suficiente para funcionar em tempo real durante o roteamento.

Por que isso importa

O roteador latency-aware incorpora a estimativa de latência diretamente na decisão de roteamento e distribui as requisições entre as instâncias de forma a manter latência, precisão e custo sob controle simultaneamente. Segundo os autores, essa otimização conjunta melhora a accuracy-cost utility em até 40%, sem piorar a latência em comparação com o balanceamento de carga comum.

«A otimização conjunta proporciona até 40% de ganho em accuracy-cost

utility, mantendo a mesma latência das abordagens padrão de balanceamento de carga», afirma o resumo do trabalho no arXiv.

Para serviços que distribuem respostas de dezenas de modelos sob carga, essa é uma forma de extrair mais qualidade a cada dólar investido, sem fazer o usuário esperar mais.

O que isso significa

O roteamento de requisições LLM deixa de ser uma escolha entre «mais barato ou mais preciso» e ganha um terceiro eixo: velocidade. Isso dá às equipes de infraestrutura uma alavanca: a mesma frota de modelos entrega mais valor sem aumento de latência e sem pagar a mais pela inferência.

Perguntas frequentes

O que é TTFT (time-to-first-token)?

TTFT é o tempo até o primeiro token da resposta, uma métrica-chave de latência em serviços LLM. O estimador do artigo prevê o TTFT para cada requisição simulando o processamento em lote de tokens no serving framework.

O quanto o roteamento latency-aware é mais eficiente que o balanceamento comum?

Segundo os autores, a otimização conjunta de latência, precisão e custo melhora a accuracy-cost utility em até 40% com a mesma latência do round-robin ou do join-the-shortest-queue.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…