NVIDIA Developer Blog→ original

NVIDIA a décrit le parallélisme tensoriel non uniforme pour l'entraînement des LLM sur GPU

NVIDIA a discuté dans son Developer Blog de la technique de parallélisme tensoriel non uniforme pour l'entraînement de grands modèles de langage sur des clusters de milliers de GPU. La méthode vise à augmenter le goodput - la proportion de travail computationnel utile - en sélectionnant individuellement le degré de parallélisme pour différentes parties du modèle.

Traité par IA depuis NVIDIA Developer Blog ; édité par Hamidun News
NVIDIA a décrit le parallélisme tensoriel non uniforme pour l'entraînement des LLM sur GPU
Source : NVIDIA Developer Blog. Collage: Hamidun News.
◐ Écouter l'article

NVIDIA a publié un article sur son Developer Blog corporatif sur le paralelisme de tenseur non uniforme — une approche conçue pour augmenter le goodput, c'est-à-dire la fraction du travail computationnel utile, lors de l'entraînement de grands modèles de langage sur des clusters de milliers de GPU.

Qu'est-ce que le Goodput dans l'entraînement des LLM

L'entraînement des grands modèles de langage modernes est de plus en plus réalisé sur des clusters de milliers de processeurs graphiques et s'étire sur des semaines, et parfois même des mois d'exploitation continue. Avec une telle durée, le coût des défaillances augmente fortement : la défaillance d'un seul nœud, le blocage d'un GPU « traînard » ou la nécessité de redémarrer à partir d'un point de contrôle consomment une partie du temps computationnel total. Goodput est une métrique qui reflète non seulement la charge totale de GPU, mais la fraction de travail véritablement utile et productif ajustée pour de telles pertes.

Parmi les causes typiques de sa réduction, il y a la congestion réseau entre les nœuds, la charge inégale sur les GPU individuels et le temps passé à sauvegarder et récupérer les points de contrôle intermédiaires après une défaillance.

  • L'article a été publié dans le Developer Blog de NVIDIA et est dédié spécifiquement à l'augmentation du goodput dans l'entraînement des LLM
  • Cela concerne l'infrastructure conçue pour les tâches couvrant des milliers de GPU simultanément
  • Ces exécutions d'entraînement peuvent durer longtemps sans s'arrêter
  • La méthode proposée s'appelle paralelisme de tenseur non uniforme — « paralelisme de tenseur non uniforme »

Comment Fonctionne Le Paralelisme De Tenseur Non Uniforme

Le paralelisme de tenseur est l'une des méthodes de base de l'entraînement distribué : les opérations de matrice individuelles dans les couches du modèle sont divisées en morceaux et calculées simultanément sur différents GPU, ce qui vous permet d'entraîner des modèles qui ne rentrent pas physiquement dans la mémoire d'une seule carte graphique. L'approche classique applique le même degré de partitionnement à toutes les couches du modèle sans distinction. La variante non uniforme décrite par NVIDIA sélectionne le degré de paralelisme individuellement pour différentes parties du modèle — en tenant compte de leur charge computationnelle et du volume de données qui doit être échangé entre les GPU.

L'objectif est de réduire le temps d'inactivité et les frais généraux de communication entre les appareils, en augmentant le goodput global sans acheter de matériel supplémentaire. Ces techniques sont généralement implémentées en conjonction avec des bibliothèques de formation distribuée comme Megatron-LM et la plateforme NeMo, que NVIDIA développe spécifiquement pour l'entraînement de grands modèles sur ses GPU.

Le paralelisme de tenseur n'est pas la seule façon de distribuer l'entraînement entre les GPU : à côté de celui-ci, le paralelisme de pipeline est utilisé, où différentes couches du modèle sont attachées à différents GPU et traitées de manière similaire à un pipeline, et le paralelisme de données, où chaque GPU stocke une copie complète du modèle, et seuls les exemples de formation eux-mêmes sont partagés entre les appareils. En pratique, les grands clusters de formation combinent les trois approches simultanément, et la qualité de la sélection de cette combinaison pour une architecture de modèle particulière détermine directement le goodput global.

Pourquoi C'est Important Pour L'Infrastructure De L'IA

Même un léger gain en pourcentage d'efficacité se traduit par des économies significatives en comptant des milliers de GPU et des semaines de formation continue. L'entraînement d'un vrai grand modèle moderne nécessite des ressources informatiques coûtant des dizaines et des centaines de millions de dollars, donc même un gain d'un pour cent en goodput se traduit par des économies significatives en temps, électricité et argent. NVIDIA, en tant que plus grand fournisseur d'accélérateurs pour l'IA, publie régulièrement de telles analyses d'ingénierie pour que ses clients — les entreprises entraînant leurs propres LLM sur l'infrastructure NVIDIA — puissent tirer plus d'efficacité des clusters déjà existants sans étendre leur flotte d'équipements.

Ce Que Cela Signifie

Conformément à la croissance de l'échelle de l'entraînement des grands modèles de langage, non seulement la quantité et la puissance des puces importent, mais aussi l'ingénierie logicielle des systèmes — l'efficacité avec laquelle l'infrastructure distribuée utilise les GPU déjà achetés.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…