FineServe: датасет реальных нагрузок обслуживания LLM с глобального маркетплейса
Исследователи представили FineServe — открытый датасет реальных нагрузок обслуживания больших языковых моделей, собранный не по прокси-трейсам, а прямо с глобального коммерческого маркетплейса. К нему прилагается генератор нагрузок, который собирает настраиваемые смеси для бенчмарка мультимодельных платформ. Цель — реалистично тестировать маршрутизацию, планирование и расчёт мощностей в системах обслуживания LLM. Датасет опубликован на GitHub.
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Des chercheurs ont présenté FineServe, un jeu de données ouvert sur les charges de travail réelles de service de LLM, collecté à partir d'une place de marché commerciale mondiale et publié sur arXiv en juillet 2026 (arXiv:2607.19349). Avec ce jeu de données, les auteurs ont publié un générateur de charges de travail pour le benchmarking des plateformes de service multi-modèles.
Qu'est-ce que FineServe
FineServe est un jeu de données "in-the-wild" de charges de travail serveur réelles, capturé sur une place de marché commerciale de LLM en production, où différents modèles et tâches sont servis en parallèle. Contrairement aux données synthétiques, il enregistre la manière dont les requêtes arrivent réellement et le comportement des tokens sur des modèles hétérogènes.
- Type : jeu de données multi-modèles de charges de travail de service de LLM
- Source des données : place de marché commerciale mondiale de LLM
- Publication : arXiv:2607.19349, juillet 2026
- Composants : le jeu de données lui-même + un générateur de charges de travail (workload generator)
- Accès : code et données ouverts sur GitHub
Pourquoi les traces proxy ne suffisent pas
Les recherches existantes sur le service de LLM s'appuient sur des traces proxy ou des généralisations à gros grain qui ne capturent pas l'hétérogénéité des plateformes multi-modèles actuelles. FineServe comble cette lacune : les auteurs ont analysé la dynamique d'arrivée des requêtes et le comportement des tokens selon trois axes à la fois — l'architecture du modèle, son échelle et le type de tâche — et ont découvert des régimes de fluctuation de charge fondamentalement différents.
C'est important pour les ingénieurs qui font tourner des LLM comme service en ligne always-on : une faible latence et un débit élevé face à une demande erratique nécessitent une compréhension précise du profil de trafic réel, et non une image moyennée.
Ce qu'apporte le générateur de charges de travail
Le générateur de charges de travail de FineServe assemble des profils à grain fin, "conscients du modèle", en mélanges configurables adaptés à un scénario de benchmark précis. Autrement dit, une équipe peut reproduire une charge proche de la production et l'utiliser pour tester des stratégies de routage, d'ordonnancement et de planification de capacité.
«
En révélant ces dynamiques de charge à grain fin, FineServe fournit une base réaliste pour évaluer les stratégies de routage, d'ordonnancement et de planification de capacité dans les systèmes de service de LLM », indique le résumé de l'article sur arXiv.
Selon la formulation des auteurs, la valeur clé est précisément l'heterogeneity : différents modèles et types de requêtes se comportent différemment, et un benchmark moyenné masque ce phénomène.
Ce que cela signifie
Pour ceux qui exploitent des plateformes multi-modèles (et AlpinaGPT ainsi que des agrégateurs similaires appartiennent exactement à cette classe de systèmes), FineServe est une raison de revérifier sur quelles traces l'infrastructure est testée. Un profil de charge réaliste influence directement le choix du routage et le nombre de GPU réellement nécessaires pour absorber les pics de demande.
Questions fréquentes
Qu'est-ce que FineServe ?
FineServe est un jeu de données ouvert sur les charges de travail réelles de service de LLM, accompagné d'un générateur de charges de travail, présenté sur arXiv (arXiv:2607.19349) en juillet 2026. Les données ont été collectées à partir d'une place de marché commerciale mondiale de modèles en activité.
En quoi FineServe diffère-t-il des traces proxy ?
Les traces proxy et les généralisations à gros grain ne rendent pas compte de l'hétérogénéité des plateformes multi-modèles. FineServe a été capturé "en production" et distingue les régimes de charge selon trois axes — l'architecture du modèle, son échelle et le type de tâche —, ce que les traces synthétiques ne permettent pas.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.