Matériel

Data center IA

Un data center IA est une installation construite exprès ou fortement rénovée pour héberger des clusters de GPUs et d'accélérateurs, conçue spécifiquement pour gérer la densité de puissance extrême, les demandes de refroidissement et le réseau haute bande passante que les charges de travail d'entraînement et d'inférence d'IA à grande échelle exigent.

Les data centers conventionnels sont conçus autour de serveurs consommant 5–15 kW par baie. Une baie de huit GPUs H100 consomme 60–80 kW, et les systèmes accélérateurs de prochaine génération dépassent 100–150 kW par baie, nécessitant une infrastructure fondamentalement différente. Les data centers IA déploient le refroidissement liquide direct — plaques froides sur les GPUs et CPUs, échangeurs thermiques arrière, ou réservoirs d'immersion complète — ainsi que la distribution électrique haute capacité et les conceptions d'installation qui privilégient la densité thermique sur l'efficacité de la surface au sol. Un cluster de 30 000 H100 peut consommer plus de 100 MW en continu, comparable à la charge résidentielle d'une petite ville.

La couche réseau est tout aussi distinctive. Les data centers IA supportent des topologies fat-tree ou rail-optimisées InfiniBand ou RoCE Ethernet avec des commutateurs agrégant des centaines de ports haute bande passante par baie. Le stockage doit livrer les données d'entraînement assez rapidement pour éviter la famine GPU, nécessitant des arrays all-flash ou des systèmes de fichiers distribués haute capacité tels que Lustre, WEKA, ou IBM Spectrum Scale. La sélection du site est fortement motivée par la puissance : les installations sont de plus en plus co-localisées avec des sous-stations ou construites près de sources d'énergie abondantes — hydroélectrique en Scandinavie et dans le nord-ouest du Pacifique américain, sites adjacents au nucléaire dans le Midwest américain — car les demandes de plusieurs centaines de mégawatts surchargent les grilles régionales.

Les data centers IA sont devenus une catégorie majeure d'investissement en capital en 2024–2025, avec Microsoft, Google, Amazon, Meta et Oracle annonçant collectivement des centaines de milliards de dollars d'engagements de construction. Le partenariat de Microsoft avec OpenAI inclut des objectifs de capacité multi-gigawatts sur plusieurs continents. La sélection géographique du site est gouvernée par le coût et la disponibilité de la puissance, l'accès à l'eau pour le refroidissement, la connectivité des câbles sous-marins, l'environnement réglementaire et la politique fiscale. Les États-Unis, la Suède, la Finlande, Singapour et les Émirats Arabes Unis sont devenus des hubs significatifs, et plusieurs juridictions ont introduit des parcours de permis spécifiquement pour les installations d'échelle IA.

En 2026, une nouvelle génération d'installations est conçue autour de 100+ kW par baie, optique co-emballée pour réduire la puissance d'interconnect, et dans certains cas la génération d'énergie sur site (turbines à gaz, petits réacteurs nucléaires modulaires en développement). L'« usine d'IA » — une installation dont la production principale est la vente de calcul d'inférence — est devenue une classe d'actifs immobiliers et d'infrastructure distincte. Les défis persistants incluent la capacité du réseau électrique, la consommation d'eau pour le refroidissement, et la chronologie de construction de 18–36 mois, qui crée un décalage structurel avec les cycles matériels GPU qui se renouvellent tous les 12–18 mois.

Exemple

Un fournisseur de cloud construisant un cluster de 30 000 H100 sélectionne un campus avec 120 MW de puissance contractée, conçoit chaque baie pour le refroidissement liquide direct à une charge de 80 kW, et déploie un réseau InfiniBand fat-tree 400G pour maintenir la latence all-reduce dans le budget nécessaire pour maintenir une utilisation élevée des GPUs.

Termes liés

Dernières actualités sur le sujet

← Glossaire