Accélérateur IA
Un accélérateur IA est tout processeur ou bloc matériel — GPU, TPU, NPU, FPGA ou ASIC personnalisé — conçu pour accélérer les calculs matriciels et les opérations de parallélisme de données essentiels à l'entraînement et l'exécution de modèles d'intelligence artificielle.
Un accélérateur IA est une catégorie de matériel informatique spécifiquement architecturé pour exécuter les opérations numériques — principalement les multiplications matricielles, les convolutions et les nonlinéarités élément par élément — qui constituent l'essentiel de la charge de travail dans l'entraînement et l'inférence d'apprentissage automatique. Le terme est intentionnellement large, couvrant les cartes d'accélérateur discrètes (GPU, ASIC d'IA dédiés), les blocs intégrés sur puce (NPU), le silicium reconfigurable (FPGA) et les architectures non-von-Neumann émergentes telles que les puces photoniques ou neuromorphiques.
Les CPU à usage général gèrent efficacement le code séquentiel et ramifié quelconque, mais consacrent la plupart de leur budget de transistors à la logique de contrôle, la prédiction de branche et la hiérarchie du cache. Les charges de travail d'IA impliquent une arithmétique hautement régulière et parallèle aux données sur de grands tenseurs avec des modèles d'accès prévisibles. Les accélérateurs exploitent cette régularité en utilisant des unités SIMD larges, des réseaux systoliques ou des noyaux tenseur — le terme de NVIDIA pour les moteurs de matrice en précision mixte introduits dans l'architecture GPU Volta en 2017 — et en couplant la mémoire à bande passante élevée (HBM) directement au composant de calcul pour soutenir le débit de données que ces unités exigent.
Les accélérateurs IA importent car ils réduisent le coût et l'énergie de la mise à l'échelle des modèles d'IA. L'entraînement de GPT-3 en 2020 a coûté plusieurs millions de dollars estimés en calcul sur le matériel GPU contemporain ; en 2024–2025, l'entraînement des modèles frontier a nécessité des clusters d'accélérateurs spécifiquement conçus fonctionnant pendant des mois — une échelle économiquement irréalisable avec les CPU. Lors de l'inférence, les accélérateurs maintiennent la latence suffisamment faible pour permettre les applications interactives : une réponse de chatbot, la génération d'images en temps réel ou l'analyse d'imagerie médicale.
En 2026, le marché des accélérateurs IA est dominé par les GPU H100 et H200 de NVIDIA pour l'entraînement en centre de données, avec les TPU de Google et une cohorte croissante de silicium personnalisé — Amazon Trainium, Microsoft Maia, Meta MTIA, Groq LPU, Cerebras WSE — ciblant les niches d'inférence ou d'entraînement. En périphérie, les NPU dans les SoC mobiles et PC gèrent l'inférence sur appareil. La pression concurrentielle pour construire des accélérateurs propriétaires s'est intensifiée car le calcul d'IA représente une fraction dominante des dépenses d'exploitation pour les grands laboratoires d'IA et les fournisseurs de cloud.