GPUDirect et TurboQuant : AWS accélère le chargement des grands LLMs sur GPU
AWS a introduit des optimisations pour accélérer le chargement des grands LLMs sur GPU : GPUDirect pour Amazon FSx for Lustre et TurboQuant pour la quantification. Les technologies aident à réduire le temps critique d'attente avant le début de l'inférence lors du travail avec des modèles contenant des centaines de milliards de paramètres.
Traité par IA depuis AWS Machine Learning Blog ; édité par Hamidun News
AWS a décrit dans le AWS Machine Learning Blog un problème que les équipes rencontrent de plus en plus en déployant de grands modèles de langage (LLMs) sur des instances GPU dans le cloud : plus le modèle qui doit être chargé dans la mémoire haute vitesse des accélérateurs graphiques (High Bandwidth Memory, HBM) est grand, plus il faut attendre avant que les GPU soient prêtes pour l'inférence. En juger par le titre de la publication, l'entreprise propose de résoudre ce problème avec une combinaison de technologies GPUDirect et TurboQuant, accélérant le chargement de grands modèles sur GPU.
Quel Est le Problème avec le Chargement de Grands Modèles ?
Les modèles de langage modernes contiennent des centaines de milliards de paramètres, et les clusters de GPU sur lesquels ils sont déployés continuent de croître en taille. Charger les poids d'un tel modèle à partir du disque ou du stockage en cloud dans la mémoire GPU n'est pas une opération instantanée : les données doivent passer par plusieurs liaisons intermédiaires dans l'infrastructure avant de se retrouver dans le HBM de la carte graphique et le modèle puisse commencer à répondre aux demandes. Chaque seconde supplémentaire d'inactivité des instances GPU coûteuses en attente du chargement se traduit directement par de l'argent perdu — en particulier lors d'une mise à l'échelle fréquente, de redémarrages d'instances ou du déploiement de nouvelles versions de modèle en production.
Faits clés :
- La discussion porte sur le chargement d'LLMs en mémoire haute vitesse GPU (HBM).
- Le problème s'intensifie à mesure que les modèles atteignent des centaines de milliards de paramètres.
- Les clusters de GPU pour l'inférence continuent de croître à grande échelle.
- La solution proposée par AWS combine les technologies GPUDirect et TurboQuant.
- Le matériel est publié dans le AWS Machine Learning Blog.
Comment GPUDirect Accélère-t-il le Processus ?
GPUDirect est le nom général d'une famille de technologies d'accès direct à la mémoire GPU, qui permettent aux données de se déplacer entre le stockage (ou la carte réseau) et la mémoire de la carte graphique directement, contournant les copies inutiles via la RAM hôte et le processeur. Dans le contexte du chargement de grands modèles, cela signifie que les poids du modèle peuvent circuler du stockage rapide directement dans le HBM GPU sans créer un goulot d'étranglement du côté du CPU — c'est précisément ces copies intermédiaires qui étaient traditionnellement l'une des raisons des longs temps de démarrage des grands modèles sur les instances GPU.
Qu'est-ce que TurboQuant Offre ?
La deuxième partie de la solution, TurboQuant, à en juger par le nom, concerne la quantification — une technique pour compresser les poids du modèle en réduisant la précision de la représentation des nombres, par exemple en passant de nombres 32 ou 16 bits à des formats plus compacts. Moins le volume de données qui doit être transféré vers la mémoire GPU est important, plus vite est le chargement à conditions égales. Pour les équipes exploitant les LLMs en production, une combinaison d'un chemin de transfert de données plus rapide (GPUDirect) et d'un volume de données réduit grâce à la quantification peut en théorie réduire considérablement le temps entre le démarrage d'une instance GPU et le moment où le modèle est prêt à servir la première demande — une mesure d'une importance critique à la fois pour la mise à l'échelle automatique sous charge et pour le coût total de possession de l'infrastructure d'IA dans le cloud.
Pourquoi C'est Important Maintenant
Le problème du démarrage à froid pour les grands modèles est particulièrement aigu pour les services qui reposent sur la mise à l'échelle automatique du nombre d'instances GPU en fonction de la charge : si l'ajout d'une nouvelle instance pour un pic de trafic prend des minutes en raison du lent chargement des poids, les utilisateurs pendant cette période font soit face à des retards de réponse, soit les demandes sont traitées par un nombre insuffisant d'accélérateurs. À mesure que les entreprises passent d'expériences avec des modèles relativement petits au déploiement industriel de modèles avec des centaines de milliards de paramètres, le temps de chargement cesse d'être un détail technique secondaire et devient un facteur affectant directement la réactivité du service et le temps GPU coûteux dépensé à attendre plutôt qu'à un calcul utile.
Pour un fournisseur de cloud comme AWS, accélérer le chargement du modèle est aussi une question de compétitivité de sa propre infrastructure : les clients déployant des LLMs en production comparent non seulement le coût de la location d'instances GPU, mais aussi combien de temps et d'argent vont dans l'ensemble du cycle depuis le démarrage jusqu'à la disponibilité pour accepter le trafic réel. La publication de tels analyses d'ingénierie dans le AWS Machine Learning Blog résout simultanément un problème pratique — partage d'optimisations avec la communauté des développeurs — et sert de démonstration que le fournisseur travaille systématiquement à l'élimination des goulots d'étranglement que les utilisateurs des GPU en cloud rencontrent en pratique lors de la mise à l'échelle de leurs propres services d'IA.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.