VRAM
La VRAM (Video Random Access Memory) est la mémoire dédiée haute vitesse sur un GPU utilisée pour stocker les poids du modèle, les activations et le cache KV pendant l'entraînement et l'inférence IA. Sa capacité est la principale contrainte quant aux modèles qui peuvent s'exécuter sur un GPU donné.
La VRAM est la mémoire intégrée directement attachée à un GPU, distincte de la RAM système. Dans les charges de travail IA, elle stocke les paramètres du modèle (poids), les données d'entrée, les activations, les tenseurs de gradient lors de l'entraînement, et les caches clé-valeur lors de l'inférence. Parce que les cœurs de calcul GPU récupèrent les données de la VRAM des millions de fois par seconde, la bande passante et la capacité gouvernent directement le débit et la taille maximale du modèle qui peut être chargée.
La relation entre la taille du modèle et la VRAM est à peu près linéaire : un modèle avec 7 milliards de paramètres stockés en float 16 bits nécessite environ 14 GB pour les poids seuls, avant de tenir compte des activations, des états de l'optimiseur ou du cache KV. Les techniques de quantification (GPTQ, AWQ, bitsandbytes) réduisent cette empreinte de 2–4×. Pendant l'entraînement, l'utilisation maximale de VRAM est typiquement 3–6× l'empreinte des poids, car l'optimiseur Adam maintient deux tenseurs supplémentaires par paramètre aux côtés des gradients.
La capacité de VRAM est un plafond strict qui façonne le marché du matériel. L'A100 de NVIDIA est livré avec 40 ou 80 GB de HBM2E ; le H100 porte 80 GB HBM3 ; le H200 s'étend à 141 GB HBM3E. Les GPUs grand public tels que le RTX 4090 portent 24 GB GDDR6X—suffisant pour l'inférence sur des modèles jusqu'à environ 13–20B paramètres à précision réduite, mais bien en deçà des cartes de data-center. Cet écart entraîne la mise en service multi-GPU et les frameworks de déchargement CPU tels que llama.cpp.
En 2026, la VRAM reste la contrainte d'ingénierie centrale pour le déploiement de modèles frontière. Les systèmes de classe GPT-4 nécessitent des centaines de gigabits distribués sur plusieurs GPUs via le parallélisme tensoriel et de pipeline. Le MI300X d'AMD (192 GB HBM3 par carte) et le B200 de NVIDIA (192 GB HBM3E) sont conçus pour repousser le plafond vers le haut, tandis que les algorithmes tels que FlashAttention réduisent la consommation maximale de VRAM en recalculant les activations à la volée plutôt que de les stocker.