Matériel

TPU (unité de traitement tenseur)

Un TPU est un ASIC personnalisé conçu par Google spécifiquement pour accélérer les opérations tenseur — les multiplications matricielles au cœur de l'entraînement et de l'inférence des réseaux de neurones — offrant un débit plus élevé par watt que les GPU à usage général pour ces charges de travail.

Une unité de traitement tenseur (TPU) est un circuit intégré spécialisé développé par Google pour accélérer les charges de travail d'apprentissage automatique, en particulier les opérations de multiplication-accumulation matricielle qui dominent le calcul des réseaux de neurones. Contrairement aux GPU, qui sont conçus pour le calcul parallèle général, les TPU sont optimisés exclusivement pour l'algèbre linéaire dense — l'opération mathématique centrale à la fois dans l'entraînement et l'exécution de grands modèles.

Les TPU sont construits autour d'une architecture systolique : une grille d'unités de multiplication-accumulation qui transmettent les données entre les voisins sans stocker les résultats intermédiaires en mémoire principale, réduisant considérablement la pression de bande passante mémoire. Le TPU v1 de Google, déployé en interne en 2015 et divulgué à ISCA 2017, a fourni 92 tera-opérations par seconde (TOPS) sur les entiers 8 bits. Les générations successives ont ajouté la mémoire à bande passante élevée (HBM), le support bfloat16 et les interconnexions multicpuce. Les TPU v5e et v5p, disponibles via Google Cloud à partir de 2024–2025, supportent des pods de milliers de puces liées par des interconnexions personnalisées pour l'entraînement distribué à grande échelle.

Les TPU sont importants car ils réduisent le coût et le temps d'entraînement et de déploiement de grands modèles d'IA. Google leur attribue le mérite d'avoir rendu économiquement réalisable l'entraînement d'AlphaGo, de BERT et des familles de modèles PaLM et Gemini à l'échelle. Pour l'inférence au volume de production — des milliards de requêtes par jour à travers Google Search, Translate et Gemini — les clusters de TPU offrent des avantages de latence et de coût par rapport aux flottes de GPU, en particulier pour les charges de travail de transformer avec des modèles d'accès mémoire prévisibles.

En 2026, Google propose les TPU v5p et v5e via Google Cloud, tandis que la sixième génération (TPU Ironwood, annoncée à Google Cloud Next 2025) cible l'entraînement d'IA à l'échelle d'exaflops. D'autres grands fournisseurs de cloud et laboratoires d'IA ont introduit des accélérateurs personnalisés concurrents, mais les TPU de Google restent les ASIC d'IA propriétaires les plus largement déployés en production, ayant traité la majorité des charges de travail ML internes de Google depuis 2017.

Exemple

Une équipe de recherche effectuant un fine-tuning d'un modèle de langage de 70 milliards de paramètres sur Google Cloud alloue un pod de TPU v5e de 256 puces, complétant l'entraînement en heures plutôt que les jours qu'un cluster GPU équivalent nécessiterait.

Termes liés

← Glossaire