arXiv cs.AI→ original

FineServe: датасет реальных нагрузок обслуживания LLM с глобального маркетплейса

Исследователи представили FineServe — открытый датасет реальных нагрузок обслуживания больших языковых моделей, собранный не по прокси-трейсам, а прямо с глобального коммерческого маркетплейса. К нему прилагается генератор нагрузок, который собирает настраиваемые смеси для бенчмарка мультимодельных платформ. Цель — реалистично тестировать маршрутизацию, планирование и расчёт мощностей в системах обслуживания LLM. Датасет опубликован на GitHub.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
FineServe: датасет реальных нагрузок обслуживания LLM с глобального маркетплейса
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores han presentado FineServe, un dataset abierto de cargas de trabajo reales de servicio de LLM, recopilado de un mercado comercial global y publicado en arXiv en julio de 2026 (arXiv:2607.19349). Junto con el dataset, los autores publicaron un generador de cargas de trabajo para el benchmarking de plataformas de servicio multimodelo.

Qué es FineServe

FineServe es un dataset "in-the-wild" de cargas de trabajo de servidor reales, capturado de un mercado comercial de LLM en funcionamiento, donde se sirven en paralelo distintos modelos y tareas. A diferencia de los datos sintéticos, registra cómo llegan realmente las solicitudes y cómo se comportan los tokens en modelos heterogéneos.

  • Tipo: dataset multimodelo de cargas de trabajo de servicio de LLM
  • Fuente de datos: mercado comercial global de LLM
  • Publicación: arXiv:2607.19349, julio de 2026
  • Componentes: el propio dataset + un generador de cargas de trabajo (workload generator)
  • Acceso: código y datos abiertos en GitHub

Por qué las trazas proxy no sirven

Las investigaciones existentes sobre el servicio de LLM se basan en trazas proxy o en generalizaciones de grano grueso que no capturan la heterogeneidad de las plataformas multimodelo actuales. FineServe cierra esta brecha: los autores analizaron la dinámica de llegada de solicitudes y el comportamiento de los tokens en tres ejes a la vez —la arquitectura del modelo, su escala y el tipo de tarea— y encontraron regímenes de fluctuación de carga fundamentalmente distintos.

Esto es importante para los ingenieros que mantienen LLM como un servicio online always-on: la baja latencia y el alto throughput ante una demanda irregular requieren una comprensión precisa del perfil de tráfico real, no una imagen promediada.

Qué ofrece el generador de cargas de trabajo

El generador de cargas de trabajo de FineServe ensambla perfiles de grano fino, "conscientes del modelo", en mezclas configurables adaptadas a un escenario de benchmark concreto. Es decir, un equipo puede reproducir una carga cercana a la de producción y usarla para probar estrategias de enrutamiento, planificación y cálculo de capacidad.

"Al revelar estas dinámicas de carga de grano fino,

FineServe ofrece una base realista para evaluar estrategias de enrutamiento, planificación y planificación de capacidad en sistemas de servicio de LLM", señala el resumen del trabajo en arXiv.

Según la formulación de los autores, el valor clave es precisamente la heterogeneity: distintos modelos y tipos de solicitud se comportan de forma diferente, y un benchmark promediado lo oculta.

Qué significa esto

Para quienes operan plataformas multimodelo (y AlpinaGPT y agregadores similares son exactamente esta clase de sistemas), FineServe es un motivo para verificar con qué trazas se está probando la infraestructura. Un perfil de carga realista influye directamente en la elección del enrutamiento y en cuántas GPU se necesitan realmente para la demanda pico.

Preguntas frecuentes

¿Qué es FineServe?

FineServe es un dataset abierto de cargas de trabajo reales de servicio de LLM más un generador de cargas de trabajo, presentados en arXiv (arXiv:2607.19349) en julio de 2026. Los datos se recopilaron de un mercado comercial global de modelos en funcionamiento.

¿En qué se diferencia FineServe de las trazas proxy?

Las trazas proxy y las generalizaciones de grano grueso no transmiten la heterogeneidad de las plataformas multimodelo. FineServe se capturó "en producción" y distingue regímenes de carga en tres ejes —la arquitectura del modelo, su escala y el tipo de tarea—, algo que las trazas sintéticas no ofrecen.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…