arXiv cs.AI→ original

Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency

Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, investigadores publicaron en arXiv un artículo sobre un enrutador de solicitudes LLM con conciencia de latencia (latency-aware) que optimiza conjuntamente la latencia, la precisión y el costo, logrando hasta un 40% de mejora en accuracy-cost utility con la misma latencia que el balanceo de carga estándar.

Qué falla en los enrutadores actuales

Los enrutadores de solicitudes LLM actuales solo equilibran la calidad de la respuesta y el costo monetario, pero no tienen en cuenta la latencia de generación en una instancia de modelo específica. En la práctica, la latencia se gestiona mediante políticas de balanceo de carga independientes —round-robin o join-the-shortest-queue—, que ignoran tanto la precisión del modelo como el costo de inferencia. Como resultado, el enrutamiento y la distribución de carga funcionan a ciegas el uno respecto del otro.

  • El objetivo es optimizar conjuntamente tres parámetros: latency, accuracy y cost
  • Políticas de balanceo básicas: round-robin, join-the-shortest-queue
  • Mejora en accuracy-cost utility: hasta 40%
  • La latencia se mantiene al nivel de los enfoques estándar
  • Fuente: preprint de arXiv (sección cs.AI), julio de 2026

Cómo se estima la latencia de una solicitud

Los autores construyeron un estimador ligero (lightweight) que simula el procesamiento por lotes (batch) autorregresivo de tokens en un serving framework y predice el TTFT (time-to-first-token) para cada solicitud. La dificultad radica en que la latencia no depende solo de la longitud del prompt: también la afectan la carga actual de prefill y decode en la instancia del modelo, así como la política de scheduling y batching del propio framework. El estimador tiene en cuenta todos estos factores y sigue siendo lo bastante económico como para funcionar en tiempo real durante el enrutamiento.

Por qué es importante

El enrutador latency-aware incorpora la estimación de latencia directamente en la decisión de enrutamiento y distribuye las solicitudes entre las instancias de modo que se mantengan bajo control simultáneamente la latencia, la precisión y el costo. Según los autores, esta optimización conjunta mejora la accuracy-cost utility hasta en un 40%, sin empeorar la latencia respecto al balanceo de carga habitual.

«La optimización conjunta ofrece hasta un 40% de mejora en

accuracy-cost utility manteniendo la misma latencia que los enfoques estándar de balanceo de carga», señala el resumen del trabajo en arXiv.

Para los servicios que reparten respuestas de decenas de modelos bajo carga, esta es una forma de extraer más calidad por cada dólar invertido, sin hacer esperar más al usuario.

Qué significa esto

El enrutamiento de solicitudes LLM deja de ser una elección entre «más barato o más preciso» y añade un tercer eje: la velocidad. Esto da a los equipos de infraestructura una palanca: la misma flota de modelos entrega más valor sin aumentar la latencia y sin pagar de más por la inferencia.

Preguntas frecuentes

¿Qué es el TTFT (time-to-first-token)?

El TTFT es el tiempo hasta el primer token de la respuesta, una métrica clave de latencia en los servicios LLM. El estimador del artículo predice el TTFT para cada solicitud simulando el procesamiento por lotes de tokens en el serving framework.

¿Cuánto más eficiente es el enrutamiento latency-aware frente al

balanceo habitual?

Según los autores, la optimización conjunta de latencia, precisión y costo mejora la accuracy-cost utility hasta en un 40% con la misma latencia que round-robin o join-the-shortest-queue.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…