Matériel

FLOPS

FLOPS (Floating-Point Operations Per Second, opérations en virgule flottante par seconde) mesure le nombre d'opérations arithmétiques en virgule flottante qu'un processeur exécute chaque seconde. C'est le benchmark principal pour comparer le matériel d'IA, les GPUs haut de gamme modernes livrant des milliers de teraFLOPS aux formats de précision réduite utilisés en entraînement d'IA.

FLOPS est une unité de débit de calcul égale à une opération en virgule flottante par seconde. Les préfixes d'ordre supérieur sont standard : un teraFLOPS (TFLOPS) équivaut à 10^12 opérations par seconde, un petaFLOPS équivaut à 10^15, et un exaFLOPS équivaut à 10^18. La métrique s'applique aux CPUs, GPUs, et accélérateurs d'IA spécialisés de la même façon, bien que les charges de travail d'IA dépendent presque exclusivement des GPUs et du silicium personnalisé où les chiffres FLOPS sont les plus élevés.

Les opérations en virgule flottante impliquent l'arithmétique sur les nombres avec précision décimale. Le matériel d'IA moderne fonctionne fréquemment sur des formats de précision réduite — FP16, BF16, ou FP8 — plutôt que FP32 complet, multipliant le débit effectif tout en acceptant des compromis de précision mineurs. Les fabricants publient donc de multiples chiffres FLOPS pour la même puce selon le type de données. Le H100 SXM d'NVIDIA offre environ 2 000 TFLOPS en BF16 dense et environ 67 TFLOPS en FP32 ; le Blackwell B200 double à peu près le débit BF16 par rapport au H100 et offre un débit substantially plus élevé en FP8. Comparer les puces sans spécifier le type de données est trompeur.

Les chiffres FLOPS déterminent directement la vitesse à laquelle les modèles d'IA peuvent être entraînés et servis. Les modèles linguistiques plus grands nécessitent plus d'arithmétique par token d'entraînement, donc les chercheurs expriment également le coût total d'entraînement comme un décompte FLOPs agrégé — un total sans dimension plutôt qu'un taux. Les lois de l'échelle documentées par OpenAI et DeepMind au début des années 2020 ont montré que la performance du modèle s'améliore de manière prévisible avec le calcul d'entraînement total, rendant FLOPS une variable de planification centrale pour les labos d'IA frontière. Le coût d'entraînement estimé du GPT-4 s'élevait à des dizaines de millions de dollars, motivé principalement par les GPU-heures consommées.

En 2026, les grands clusters d'entraînement d'IA agrègent des dizaines de milliers de GPUs B200 ou H200 d'NVIDIA ou d'accélérateurs personnalisés équivalents de Google, Amazon et Microsoft, atteignant un débit agrégé multi-exaFLOPS. Les exécutions d'entraînement pour les modèles frontières leaders consomment régulièrement entre 10^24 et 10^25 FLOPs totaux. Les améliorations algorithmiques — incluant les architectures mixture-of-experts et une meilleure curation des données — ont partiellement compensé la demande de calcul brut par unité de qualité du modèle, mais l'investissement total en matériel au niveau du cluster continue de croître.

Exemple

Lors de l'évaluation des offres GPU cloud pour une tâche d'entraînement distribué, un ingénieur ML vérifie que le cluster réservé offre suffisamment de TFLOPS en précision BF16 pour compléter l'entraînement dans le délai et le budget du projet avant de s'engager dans une réservation de capacité.

Termes liés

Dernières actualités sur le sujet

← Glossaire