IEEE Spectrum AI→ original

Prometheus: serveur Majestic Labs avec 128 TB de mémoire pour l'IA

La startup Majestic Labs travaille sur le serveur Prometheus, conçu pour résoudre le problème de la mémoire limitée lors du travail avec de grands modèles de langage. Contrairement au NVIDIA DGX B300 avec 2 TB de mémoire, Prometheus peut contenir jusqu'à 128 TB. L'entreprise prépare une architecture orientée DRAM qui remplacera l'approche combinée traditionnelle (HBM+DRAM).

Traité par IA depuis IEEE Spectrum AI ; édité par Hamidun News
Prometheus: serveur Majestic Labs avec 128 TB de mémoire pour l'IA
Source : IEEE Spectrum AI. Collage: Hamidun News.
◐ Écouter l'article

La startup de matériel IA Majestic Labs développe un nouveau serveur IA Prometheus avec une capacité mémoire allant jusqu'à 128 térabytes — plus de 60 fois la capacité du serveur phare DGX B300 de Nvidia, l'un des systèmes en série les plus puissants pour traiter les charges de travail IA du marché. Comme le rapporte IEEE Spectrum, l'entreprise mise sur une architecture entièrement construite autour de la mémoire DRAM pour résoudre le problème du soi-disant "mur mémoire" (memory wall) — l'un des principaux goulots d'étranglement des performances pour l'inférence dans les grands modèles de langage.

Pourquoi la mémoire est devenue le principal goulot d'étranglement pour l'IA

  • Produit — serveur Prometheus de Majestic Labs
  • Capacité mémoire — jusqu'à 128 térabytes
  • Comparaison — plus de 60 fois plus de mémoire que Nvidia DGX B300
  • Architecture — unifiée, entièrement basée sur DRAM (spécifiquement LPDDR6), contrairement à la combinaison HBM et DRAM de Nvidia
  • Figure clé — Sha Rabii, cofondateur et président de Majestic Labs

Selon des travaux scientifiques influents cités par IEEE Spectrum, la génération de tokens dans les grands modèles de langage est fondamentalement limitée par la vitesse de la mémoire : la vitesse à laquelle un modèle produit du texte est déterminée par la rapidité avec laquelle les données — principalement les poids du modèle — peuvent être lues de la mémoire, non par la rapidité d'opération des unités de calcul. Plus le modèle est grand, plus ce problème devient aigu, et finalement un "mur mémoire" émerge, ce qui limite les performances d'inférence indépendamment de la croissance de la puissance de calcul des processeurs — peu importe le nombre de cœurs et de blocs tenseurs que les ingénieurs ajoutent, la vitesse finale de sortie de texte est limitée par la bande passante de la mémoire et la capacité de mémoire disponible.

Comment l'architecture DRAM de

Prometheus diffère de l'approche de Nvidia

Le cofondateur et président de Majestic Labs, Sha Rabii, estime que l'échelle de la mémoire donne à l'entreprise un avantage concurrentiel. Selon lui, Nvidia "a fait un travail phénoménal en créant un système capable de se scaler", mais à mesure que les modèles se développent, cette approche devient de moins en moins économique : le système "finit par une puissance de calcul excessive et la faim de mémoire". Les serveurs Nvidia utilisent aujourd'hui de la mémoire rapide à haut débit (HBM) — généralement pour stocker les poids du modèle — et un pool DRAM séparé, généralement plus grand mais plus lent, qui gère les autres tâches LLM et les frais généraux du serveur.

Majestic Labs a choisi un chemin fondamentalement différent : une architecture unifiée entièrement construite sur DRAM, spécifiquement de la mémoire LPDDR6, sans division en pools rapides et lents. Selon Rabii, la plupart des interfaces mémoire sont conçues pour fonctionner à des distances physiques très courtes — parfois seulement quelques millimètres — et c'est précisément ce qui limite physiquement la quantité de mémoire pouvant être placée dans un système tout en maintenant une bande passante élevée.

Ce que cela pourrait signifier pour le marché de l'infrastructure IA

Si le pari de Majestic Labs s'avère fructueux, l'entreprise offrira au marché une source alternative de puissance de calcul pour les charges de travail qui manquent aujourd'hui de mémoire — travail avec contexte long, modèles d'experts mixtes avec un grand volume total de paramètres sous activation clairsemée, utilisation intensive du cache KV lors de la desserte de plusieurs demandes parallèles. Cela remet en question l'hypothèse commune que la course à l'infrastructure IA consiste principalement en le nombre de processeurs graphiques et la puissance de calcul en FLOPs : Prometheus déplace une partie du focus concurrentiel vers le volume et l'architecture de la mémoire. Compte tenu de la position dominante de Nvidia sur le marché des serveurs IA, le pari d'une startup sur une architecture centrée sur la mémoire plutôt que centrée sur le calcul se démarque parmi la plupart des acteurs qui suivent généralement la feuille de route axée sur le calcul définie par Nvidia ces dernières années.

Le simple fait qu'un tel projet soit en cours montre que le "mur mémoire" n'est plus un sujet académique étroit et est devenu un incitatif commercial pour lancer une nouvelle startup de matériel. Si Majestic Labs amène Prometheus à la production en série, les exploitants de centres de données et les fournisseurs de cloud auront pour la première fois depuis longtemps une véritable alternative à l'ensemble standard "GPU plus HBM", et la compétition dans le segment de l'infrastructure IA cessera d'être exclusivement une comparaison du nombre et de la génération des accélérateurs graphiques.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…