Matériel

Cluster GPU

Un cluster GPU est un ensemble de serveurs, chacun contenant plusieurs GPUs, interconnectés par une mise en réseau haute vitesse pour agir comme une seule ressource de calcul parallèle pour l'entraînement ou la mise en service de modèles IA qui dépassent la capacité d'une machine individuelle.

Un cluster GPU agrège le calcul, la mémoire et le stockage de nombreux serveurs afin que les charges de travail IA trop grandes pour une machine puissent être distribuées sur tous. Chaque serveur (nœud) porte généralement 4–16 GPUs liés par des interconnexions intranœud haute bande passante telles que NVLink, tandis que les nœuds se connectent les uns aux autres et au stockage partagé via InfiniBand ou Ethernet haute vitesse. Un planificateur de tâches—Slurm, Kubernetes ou équivalents propriétaires—alloue les ressources du cluster, surveille la santé du matériel et redémarre les tâches échouées.

La motivation principale du clustering est que l'entraînement de modèles frontière nécessite de la mémoire et du calcul bien au-delà d'un seul nœud. Les exécutions d'entraînement pour des modèles à l'échelle de GPT-4 sont estimées avoir utilisé des dizaines de milliers de GPUs équivalents A100 pendant des mois. Les frameworks d'entraînement distribué—DeepSpeed, Megatron-LM, PyTorch FSDP—divisent le travail via le parallélisme des données (différents lots sur différents GPUs), le parallélisme tensoriel (matrices de poids fragmentées sur les GPUs) et le parallélisme de pipeline (différentes couches de modèle sur différents GPUs). L'utilisation FLOP du modèle (MFU)—la fraction du pic théorique FLOPS réellement utilisé pour le calcul—est une métrique d'efficacité clé ; les valeurs de 30–50% sont considérées comme bonnes pour les grands clusters en raison de la surcharge de communication.

Les clusters GPU sont devenus l'actif capital central du développement IA. Les fournisseurs de cloud (AWS, Google Cloud, Azure) offrent un accès à la demande à des pools de plusieurs milliers de GPUs ; les principaux laboratoires IA opèrent des clusters propriétaires à plus grande échelle. Les exemples notables incluent la SuperCluster de recherche de Meta (16 000 A100, 2022) et l'installation Memphis de xAI (signalée à environ 100 000 H100, 2024). Un cluster de 10 000 GPUs H100 représente une dépense en capital matériel d'environ 300–500 millions de dollars avant l'infrastructure d'alimentation, de refroidissement et de réseau.

En 2026, des clusters de 100 000 GPUs ou plus sont en opération ou en construction active chez plusieurs laboratoires IA et fournisseurs de cloud. Les défis d'ingénierie clés à cette échelle incluent la congestion du réseau all-reduce lors de la synchronisation des gradients, la tolérance aux pannes (une panne simple d'un GPU peut bloquer une tâche d'entraînement s'étendant sur des milliers de nœuds) et la livraison d'alimentation soutenue. La mise en service désagrégée—où le prefill (traitement des invites) et le décodage (génération de tokens) s'exécutent sur des pools de GPUs séparés et dimensionnés indépendamment—a émergé comme un modèle architectural de premier plan pour l'inférence à grande échelle économe.

Exemple

L'entraînement d'un modèle de langage de 70B paramètres nécessite généralement un cluster de plusieurs milliers de GPUs H100 fonctionnant pendant des semaines, avec des groupes parallèles tensoriels de huit GPUs par nœud partageant les poids sur NVLink et les étapes de pipeline distribuées sur les nœuds via InfiniBand.

Termes liés

← Glossaire