Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
En julio de 2026, investigadores publicaron en arXiv un artículo sobre un enrutador de solicitudes LLM con conciencia de latencia (latency-aware) que optimiza conjuntamente la latencia, la precisión y el costo, logrando hasta un 40% de mejora en accuracy-cost utility con la misma latencia que el balanceo de carga estándar.
Qué falla en los enrutadores actuales
Los enrutadores de solicitudes LLM actuales solo equilibran la calidad de la respuesta y el costo monetario, pero no tienen en cuenta la latencia de generación en una instancia de modelo específica. En la práctica, la latencia se gestiona mediante políticas de balanceo de carga independientes —round-robin o join-the-shortest-queue—, que ignoran tanto la precisión del modelo como el costo de inferencia. Como resultado, el enrutamiento y la distribución de carga funcionan a ciegas el uno respecto del otro.
- El objetivo es optimizar conjuntamente tres parámetros: latency, accuracy y cost
- Políticas de balanceo básicas: round-robin, join-the-shortest-queue
- Mejora en accuracy-cost utility: hasta 40%
- La latencia se mantiene al nivel de los enfoques estándar
- Fuente: preprint de arXiv (sección cs.AI), julio de 2026
Cómo se estima la latencia de una solicitud
Los autores construyeron un estimador ligero (lightweight) que simula el procesamiento por lotes (batch) autorregresivo de tokens en un serving framework y predice el TTFT (time-to-first-token) para cada solicitud. La dificultad radica en que la latencia no depende solo de la longitud del prompt: también la afectan la carga actual de prefill y decode en la instancia del modelo, así como la política de scheduling y batching del propio framework. El estimador tiene en cuenta todos estos factores y sigue siendo lo bastante económico como para funcionar en tiempo real durante el enrutamiento.
Por qué es importante
El enrutador latency-aware incorpora la estimación de latencia directamente en la decisión de enrutamiento y distribuye las solicitudes entre las instancias de modo que se mantengan bajo control simultáneamente la latencia, la precisión y el costo. Según los autores, esta optimización conjunta mejora la accuracy-cost utility hasta en un 40%, sin empeorar la latencia respecto al balanceo de carga habitual.
«La optimización conjunta ofrece hasta un 40% de mejora en
accuracy-cost utility manteniendo la misma latencia que los enfoques estándar de balanceo de carga», señala el resumen del trabajo en arXiv.
Para los servicios que reparten respuestas de decenas de modelos bajo carga, esta es una forma de extraer más calidad por cada dólar invertido, sin hacer esperar más al usuario.
Qué significa esto
El enrutamiento de solicitudes LLM deja de ser una elección entre «más barato o más preciso» y añade un tercer eje: la velocidad. Esto da a los equipos de infraestructura una palanca: la misma flota de modelos entrega más valor sin aumentar la latencia y sin pagar de más por la inferencia.
Preguntas frecuentes
¿Qué es el TTFT (time-to-first-token)?
El TTFT es el tiempo hasta el primer token de la respuesta, una métrica clave de latencia en los servicios LLM. El estimador del artículo predice el TTFT para cada solicitud simulando el procesamiento por lotes de tokens en el serving framework.
¿Cuánto más eficiente es el enrutamiento latency-aware frente al
balanceo habitual?
Según los autores, la optimización conjunta de latencia, precisión y costo mejora la accuracy-cost utility hasta en un 40% con la misma latencia que round-robin o join-the-shortest-queue.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.