Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram no arXiv um artigo sobre um roteador de requisições LLM com consciência de latência (latency-aware) que otimiza conjuntamente latência, precisão e custo, entregando até 40% de ganho em accuracy-cost utility com a mesma latência do balanceamento de carga padrão.
O que há de errado com os roteadores atuais
Os roteadores de requisições LLM atuais equilibram apenas a qualidade da resposta e o custo monetário, mas não levam em conta a latência de geração em uma instância específica do modelo. Na prática, a latência é gerenciada por políticas de balanceamento de carga separadas — round-robin ou join-the-shortest-queue —, que ignoram tanto a precisão do modelo quanto o custo de inferência. Como resultado, o roteamento e a distribuição de carga funcionam às cegas um em relação ao outro.
- O objetivo é otimizar conjuntamente três parâmetros: latency, accuracy e cost
- Políticas básicas de balanceamento: round-robin, join-the-shortest-queue
- Ganho em accuracy-cost utility: até 40%
- A latência permanece no nível das abordagens padrão
- Fonte: preprint no arXiv (seção cs.AI), julho de 2026
Como a latência da requisição é estimada
Os autores construíram um estimador leve (lightweight) que simula o processamento em lote (batch) autorregressivo de tokens em um serving framework e prevê o TTFT (time-to-first-token) para cada requisição. A dificuldade é que a latência não depende apenas do comprimento do prompt: ela também é afetada pela carga atual de prefill e decode na instância do modelo, além da política de scheduling e batching do próprio framework. O estimador leva em conta todos esses fatores e permanece barato o suficiente para funcionar em tempo real durante o roteamento.
Por que isso importa
O roteador latency-aware incorpora a estimativa de latência diretamente na decisão de roteamento e distribui as requisições entre as instâncias de forma a manter latência, precisão e custo sob controle simultaneamente. Segundo os autores, essa otimização conjunta melhora a accuracy-cost utility em até 40%, sem piorar a latência em comparação com o balanceamento de carga comum.
«A otimização conjunta proporciona até 40% de ganho em accuracy-cost
utility, mantendo a mesma latência das abordagens padrão de balanceamento de carga», afirma o resumo do trabalho no arXiv.
Para serviços que distribuem respostas de dezenas de modelos sob carga, essa é uma forma de extrair mais qualidade a cada dólar investido, sem fazer o usuário esperar mais.
O que isso significa
O roteamento de requisições LLM deixa de ser uma escolha entre «mais barato ou mais preciso» e ganha um terceiro eixo: velocidade. Isso dá às equipes de infraestrutura uma alavanca: a mesma frota de modelos entrega mais valor sem aumento de latência e sem pagar a mais pela inferência.
Perguntas frequentes
O que é TTFT (time-to-first-token)?
TTFT é o tempo até o primeiro token da resposta, uma métrica-chave de latência em serviços LLM. O estimador do artigo prevê o TTFT para cada requisição simulando o processamento em lote de tokens no serving framework.
O quanto o roteamento latency-aware é mais eficiente que o balanceamento comum?
Segundo os autores, a otimização conjunta de latência, precisão e custo melhora a accuracy-cost utility em até 40% com a mesma latência do round-robin ou do join-the-shortest-queue.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.