NVIDIA Developer Blog→ original

NVIDIA Exemplar Cloud: почему одинаковые AI-кластеры теряют до 12% производительности

NVIDIA Exemplar Cloud: два AI-кластера на идентичных H100 или GB200 NVL72 регулярно показывают разрыв в 8–12% по пропускной способности обучения при одинаковой задаче и модели. Причина — не в железе, а в стеке конфигурационных решений на уровне ядра ОС. Программа Exemplar Cloud помогает облачным провайдерам закрыть этот разрыв, сравнивая их развёртывания с эталонной архитектурой NVIDIA.

Traité par IA depuis NVIDIA Developer Blog ; édité par Hamidun News
NVIDIA Exemplar Cloud: почему одинаковые AI-кластеры теряют до 12% производительности
Source : NVIDIA Developer Blog. Collage: Hamidun News.
◐ Écouter l'article

NVIDIA a publié sur Developer Blog une analyse du programme Exemplar Cloud : deux clusters d'AI sur des accélérateurs identiques H100, GB200 NVL72 ou GB300 NVL72 présentent régulièrement un écart de training throughput de 8% à 12% — pour la même tâche, le même modèle et la même taille de batch globale.

Pourquoi des clusters identiques donnent des résultats différents

La cause de cet écart ne réside pas dans le matériel, mais dans le choix de la configuration. Selon NVIDIA Developer Blog, la divergence de 8% à 12% entre les déploiements des partenaires et l'architecture de référence de la société (Reference Architecture, RA) provient d'un empilement de décisions de configuration au niveau du noyau du système d'exploitation. Deux clouds dotés de GPU H100 ou GB200 NVL72 identiques peuvent afficher un training throughput fondamentalement différent si leurs couches logicielles sont configurées autrement que ce que NVIDIA recommande.

Pour comprendre l'ampleur du phénomène : dans un cluster de mille accélérateurs, un écart de 10% représente des dizaines d'heures de temps de calcul par semaine. Aux prix du marché pour la location de GPU, cela se traduit par des pertes de centaines de milliers de dollars de productivité par an.

  • Systèmes comparés : NVIDIA H100, GB200 NVL72, GB300 NVL72
  • Écart constaté : de 8% à 12% en training throughput
  • Condition : même tâche, même modèle, même taille de batch globale
  • Source de l'écart : « empilement de décisions de configuration au niveau du noyau », selon NVIDIA Developer Blog

Qu'est-ce que NVIDIA Exemplar Cloud

Exemplar Cloud est un programme partenaire de NVIDIA créé pour aider les fournisseurs de cloud à atteindre les performances de l'architecture de référence. La société analyse les déploiements spécifiques de ses partenaires, les compare à la RA et identifie les « goulots d'étranglement » de configuration qui réduisent silencieusement l'efficacité des clusters. Les domaines d'optimisation typiques comprennent les paramètres de la pile réseau, les réglages NVLink et InfiniBand, la configuration du noyau Linux et la topologie NUMA.

Le programme est particulièrement pertinent en ce moment : GB200 NVL72 et GB300 NVL72 sont les derniers racks NVIDIA basés sur l'architecture Blackwell, qui sont massivement mis en service chez les plus grands fournisseurs mondiaux en 2025–2026. La concurrence pour les clients AI se joue au niveau du throughput réel, et un écart de 10% entre deux clouds disposant d'équipements identiques peut déterminer l'issue d'un grand appel d'offres.

«

Nous constatons systématiquement un écart de 8% à 12% entre les installations de partenaires et notre architecture de référence sur la même tâche, le même modèle et la même taille de batch globale », indique la publication NVIDIA Developer Blog.

Ce que cela signifie

Pour les ingénieurs ML et les équipes DevOps qui gèrent des clusters GPU, la conclusion principale est simple : disposer du bon matériel est une condition nécessaire mais non suffisante. Les 8 à 12% de performance perdus en raison de la configuration représentent de l'argent réel et un temps réel d'entraînement des modèles. Exemplar Cloud propose une approche systématique : comparer son déploiement avec la référence NVIDIA et éliminer des goulots d'étranglement spécifiques, plutôt que de chercher à deviner pourquoi le throughput est inférieur au maximum théorique. Pour les fournisseurs de cloud, atteindre les métriques de la RA devient à la fois un avantage concurrentiel et une économie opérationnelle.

Questions fréquentes

Qu'est-ce que la NVIDIA Reference Architecture ?

NVIDIA Reference Architecture (RA) est la configuration de référence du stack matériel et logiciel que NVIDIA publie pour les systèmes H100, GB200 NVL72 et GB300 NVL72. Elle sert de point de référence : les performances du déploiement d'un partenaire sont comparées à la RA afin d'identifier les divergences spécifiques.

Pourquoi un écart de 8 à 12% est-il critique pour le cloud AI ?

Dans un cluster de centaines ou de milliers d'accélérateurs GB200 NVL72, un écart de 10% dans le training throughput représente l'équivalent de 10% de coûts de calcul supplémentaires — ou autant de revenus perdus sur la location de GPU par rapport à un concurrent sur des systèmes identiques mais avec un stack mieux configuré.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…