Matériel

Interconnect (NVLink, InfiniBand)

Un interconnect est le lien de communication haute vitesse qui transfère des données entre les GPUs au sein d'un serveur (intra-nœud, par ex. NVLink) ou entre des serveurs dans un cluster (inter-nœud, par ex. InfiniBand) ; sa bande passante et sa latence sont des goulots d'étranglement principaux en entraînement et inférence d'IA distribuée.

En informatique de l'IA, interconnect désigne les liens physiques et protocoles qui déplacent les données entre les processeurs. Les interconnects intra-nœud tels que NVIDIA NVLink fonctionnent entre les GPUs sur le même serveur par le biais d'une fabric de commutation (NVSwitch) ; les interconnects inter-nœud tels que InfiniBand et RoCE (RDMA sur Converged Ethernet) connectent les serveurs dans un centre de données. Parce que les liens intra-nœud sont généralement 5–50× plus rapides que les liens inter-nœud, les algorithmes d'entraînement distribué sont structurés pour conserver les opérations les plus intensives en communication au sein d'un seul nœud.

NVLink, introduit en 2016, a évolué à travers plusieurs générations. NVLink 4.0 dans les systèmes H100 fournit 900 GB/s de bande passante bidirectionnelle par GPU quand les huit GPUs dans un nœud communiquent via NVSwitch simultanément — comparé à environ 128 GB/s pour PCIe 5.0. InfiniBand, développé à l'origine pour le calcul haute performance (HPC), offre des bandes passantes par port de 400 Gb/s (NDR, 2022) et 800 Gb/s (XDR, 2025) avec une latence sub-microsecondes, permettant les opérations all-reduce collectives qui synchronisent les gradients sur des milliers de nœuds. Les pods TPU de Google utilisent un interconnect inter-puce propriétaire (ICI) avec commutation de circuit optique entre pods pour leur propre infrastructure d'entraînement.

La performance de l'interconnect détermine comment un cluster se met à l'échelle efficacement avec l'ajout de nœuds. Si la bande passante inter-nœud est bien en dessous de la bande passante intra-nœud, les stratégies de parallélisme doivent minimiser le mouvement de données entre nœuds : les groupes tensor-parallel (qui échangent des sommes partielles à chaque couche) sont confinés au domaine NVLink d'un seul nœud, tandis que le parallélisme de pipeline (qui ne transmet que les activations entre les étapes) s'étend sur les nœuds via InfiniBand. La bande passante all-reduce — la collective qui somme les gradients sur tous les GPUs participants — fixe directement une limite supérieure sur le débit d'entraînement ; si le temps all-reduce dépasse le temps de backward-pass, les GPUs sont inactifs.

En 2026, InfiniBand 800G d'NVIDIA et le domaine NVLink Switch — capable de connecter jusqu'à 576 GPUs aux vitesses NVLink complètes sur plusieurs châssis — représentent la frontière. Les approches concurrentes incluent les normes Ultra Ethernet de Broadcom et la photonique silicium pour les liens optiques inter-bâtis qui réduisent la consommation d'énergie. La topologie du réseau d'un cluster (fat-tree, rail-optimisée, ou dragonfly) est un différenciateur principal entre l'infrastructure d'IA bien conçue et mal conçue, aussi importante pour le débit d'entraînement total que les FLOPS GPU bruts.

Exemple

Dans une configuration d'entraînement avec 64 serveurs H100 (8 GPUs chacun), les groupes tensor-parallel de 8 GPUs au sein de chaque serveur échangent des données à 900 GB/s via NVLink, tandis que l'all-reduce de gradients sur les 512 GPUs parcourt les liens InfiniBand 400G et est chevauchée avec la prochaine passe avant pour masquer la latence.

Termes liés

← Glossaire