Business

Compute

Compute, dans les contextes IA, fait référence aux ressources informatiques — principalement la puissance de traitement GPU ou TPU, la mémoire et l'infrastructure de support — requises pour entraîner et exécuter les modèles IA. C'est la ressource limitante principale et le facteur de coût dans le développement IA de pointe.

En recherche et industrie IA, « compute » est l'abréviation des ressources matérielles agrégées consommées pour exécuter les opérations mathématiques — principalement les multiplications matricielles — au cœur de l'entraînement et de l'inférence des réseaux de neurones. Il est le plus souvent quantifié comme le nombre total d'opérations en virgule flottante (FLOPs) pour une exécution d'entraînement, ou comme GPU-heures ou chip-heures consommées. Contrairement aux données ou à la conception algorithmique, les deux autres entrées canoniques du progrès IA, le compute s'achète directement avec du capital et se met à l'échelle de manière relativement prévisible avec l'investissement, en faisant à la fois un levier économique et un actif stratégique.

Le compute d'entraînement dépend de trois facteurs : le nombre de paramètres du modèle, le nombre de tokens d'entraînement traités et l'efficacité de la pile matérielle et logicielle. Le papier de mise à l'échelle Chinchilla de DeepMind (2022) a établi des directives fondées sur les principes pour allouer un budget de compute fixe entre la taille du modèle et le volume du dataset. Une exécution d'entraînement d'un modèle de langage de pointe traite des trillions de tokens sur des semaines ou des mois sur des clusters de milliers d'accélérateurs. Le compute d'inférence — le coût de servir un modèle par requête — est plus petit par requête mais peut s'accumuler à des totaux comparables ou dépassant le compute d'entraînement une fois qu'un modèle largement utilisé est déployé à grande échelle.

La disponibilité du compute est devenue une variable géopolitique. Les accélérateurs IA avancés — principalement les GPU NVIDIA H100, H200 et Blackwell — sont fabriqués par un petit nombre d'entreprises utilisant des processus de fabrication concentrés à TSMC à Taïwan. Les contrôles à l'exportation américains promulgués en octobre 2022 et élargis dans les rondes suivantes restreignent la vente de puces IA haute performance à la Chine et à certains autres pays, ciblant explicitement l'accès au compute. Ces contrôles ont directement affecté quelles organisations peuvent poursuivre des exécutions d'entraînement de pointe et ont accéléré les programmes de développement d'accélérateurs nationaux en Chine et dans l'Union européenne.

En 2026, les plus grands clusters d'entraînement IA contiennent des dizaines de milliers de GPU NVIDIA B200 ou H200 ou des accélérateurs personnalisés équivalents, représentant des dépenses en capital allant de centaines de millions à plus d'un milliard de dollars par cluster. Microsoft, Google, Meta, Amazon et xAI ont chacun annoncé ou déployé des data centers à cette échelle pour les charges de travail IA. Les fournisseurs de cloud offrent le compute à la demande ou comme capacité réservée, avec des marchés au comptant qui fluctuent avec la demande. Les améliorations d'efficacité algorithmique — architectures de mélange d'experts, meilleure curation des données et recettes d'entraînement optimisées — ont partiellement modéré les exigences de compute par unité de qualité du modèle, mais la consommation totale de compute de l'industrie continue de croître d'année en année.

Exemple

Une startup prévoyant de fine-tuner un grand modèle à poids ouverts estime que le travail nécessite environ 2 000 GPU-heures A100 et évalue les fournisseurs de cloud pour trouver le mélange le plus rentable de compute réservé et au comptant avant de s'engager dans l'exécution d'entraînement.

Termes liés

Dernières actualités sur le sujet

← Glossaire