arXiv cs.AI→ original

Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency

Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv un article sur un routeur de requêtes LLM tenant compte de la latence (latency-aware) qui optimise conjointement la latence, la précision et le coût, apportant jusqu'à 40% de gain d'accuracy-cost utility à latence égale par rapport à l'équilibrage de charge standard.

Ce qui ne va pas avec les routeurs actuels

Les routeurs de requêtes LLM actuels n'équilibrent que la qualité de la réponse et le coût monétaire, sans tenir compte de la latence de génération sur une instance de modèle donnée. En pratique, la latence est gérée par des politiques d'équilibrage de charge distinctes — round-robin ou join-the-shortest-queue —, qui ignorent à la fois la précision du modèle et le coût d'inférence. Résultat : le routage et la répartition de charge fonctionnent à l'aveugle l'un par rapport à l'autre.

  • L'objectif est d'optimiser conjointement trois paramètres : latency, accuracy et cost
  • Politiques d'équilibrage de base : round-robin, join-the-shortest-queue
  • Gain d'accuracy-cost utility : jusqu'à 40%
  • La latence reste au niveau des approches standard
  • Source : un preprint arXiv (section cs.AI), juillet 2026

Comment la latence d'une requête est estimée

Les auteurs ont construit un estimateur léger (lightweight) qui simule le traitement par lots (batch) autorégressif des tokens dans un serving framework et prédit le TTFT (time-to-first-token) pour chaque requête. La difficulté est que la latence ne dépend pas seulement de la longueur du prompt : elle est aussi affectée par la charge actuelle de prefill et de decode sur l'instance du modèle, ainsi que par la politique de scheduling et de batching du framework lui-même. L'estimateur prend en compte tous ces facteurs tout en restant assez peu coûteux pour fonctionner en temps réel lors du routage.

Pourquoi c'est important

Le routeur latency-aware intègre l'estimation de la latence directement dans la décision de routage et répartit les requêtes entre les instances de manière à maîtriser simultanément la latence, la précision et le coût. Selon les auteurs, cette optimisation conjointe améliore l'accuracy-cost utility jusqu'à 40%, sans dégrader la latence par rapport à l'équilibrage de charge classique.

« L'optimisation conjointe apporte jusqu'à 40% de gain d'accuracy-cost

utility tout en conservant la même latence que les approches standard d'équilibrage de charge », indique le résumé des travaux sur arXiv.

Pour les services qui distribuent les réponses de dizaines de modèles sous charge, c'est un moyen d'extraire davantage de qualité pour chaque dollar investi, sans faire attendre l'utilisateur plus longtemps.

Ce que cela signifie

Le routage des requêtes LLM cesse d'être un choix entre « moins cher ou plus précis » et ajoute un troisième axe : la vitesse. Cela donne aux équipes d'infrastructure un levier : le même parc de modèles délivre davantage de valeur sans augmentation de la latence et sans surpayer l'inférence.

Questions fréquentes

Qu'est-ce que le TTFT (time-to-first-token) ?

Le TTFT est le délai avant le premier token de la réponse, une métrique clé de latence dans les services LLM. L'estimateur de l'article prédit le TTFT pour chaque requête en simulant le traitement par lots des tokens dans le serving framework.

Dans quelle mesure le routage latency-aware est-il plus efficace que

l'équilibrage classique ?

Selon les auteurs, l'optimisation conjointe de la latence, de la précision et du coût améliore l'accuracy-cost utility jusqu'à 40% à latence égale par rapport à round-robin ou join-the-shortest-queue.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…