LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.
Traité par IA depuis Habr AI ; édité par Hamidun News
Les modèles avec un quadrillion de paramètres (10^15) n'apparaîtront pas dans un avenir prévisible — les contraintes physiques et computationnelles rendent cette échelle pratiquement inatteignable dans le paradigme actuel.
Jusqu'où sommes-nous d'un quadrillion aujourd'hui ?
Nous sommes mille fois plus loin de ce chiffre convoité qu'il n'y paraît. Les meilleurs modèles de langage de 2025–2026 opèrent dans une plage allant de centaines de milliards à quelques trillions de paramètres. Selon les analystes de SemiAnalysis, GPT-4 est construit sur une architecture Mixture of Experts avec un nombre total de poids d'environ 1,76 trillion ; Gemini Ultra de Google est d'environ 1,56 trillion. Pour atteindre un quadrillion (10^15), l'échelle devrait encore croître d'environ 700 à 1 000 fois.
- La plage des modèles frontier aujourd'hui : ~100 milliards — ~2 trillions de paramètres
- Un quadrillion (10^15) dépasse le volume de GPT-4 de 700 à 1 000 fois
- L'entraînement de GPT-4, selon les estimations des analystes, a coûté plus de 100 millions de dollars
- L'entraînement de Llama 2 70B, selon la documentation technique de Meta, a nécessité ~539 MWh
- Rien que stocker les poids d'un modèle 1Q au format int4 prendrait environ 125 To
Pourquoi une croissance de 1 000 fois n'est pas simplement une
question d'"attendre" ?
Un modèle avec un quadrillion de paramètres ne nécessite pas seulement plus d'argent — il exige une physique fondamentalement différente.
Les GPU phares NVIDIA H100/H200 stockent 80 à 192 Go de mémoire par carte. Même avec une quantification agressive à 1 bit, un modèle 1Q nécessiterait ~125 To rien que pour les poids, sans les activations, les gradients ni l'optimiseur. En format BF16 standard, cela représente déjà ~2 pétaoctets. Un tel volume exige la construction d'une infrastructure fondamentalement différente, qu'aucune entreprise au monde ne possède actuellement.
«
Nous observons des rendements décroissants du simple scaling du nombre de paramètres — les données et l'efficacité computationnelle importent plus que la taille brute », selon les publications de recherche de l'équipe DeepMind sur l'optimisation Chinchilla.
La consommation d'énergie s'ajoute au défi physique. Selon les estimations, l'entraînement d'un modèle 1Q avec l'efficacité actuelle des puces nécessiterait des dizaines à des centaines de TWh — comparable à la consommation annuelle d'électricité d'un pays européen moyen.
Pourquoi les données ne suffiront pas pour un quadrillion ?
Selon la recherche DeepMind (Hoffmann et al., 2022), pour un entraînement optimal en termes de calcul, un modèle doit être entraîné sur environ 20 tokens par paramètre. Par conséquent, un modèle 1Q devrait être entraîné sur 20 quadrillions de tokens. Selon diverses estimations de recherche, l'ensemble du texte numérisé d'Internet représente environ 10^13–10^14 tokens, soit 200 à 2 000 fois moins que ce qui est nécessaire.
Les données synthétiques atténuent partiellement la contrainte, mais pas à une échelle de mille fois et pas sans dégradation de la qualité lors de la génération en boucle. Autrement dit, même si l'infrastructure computationnelle existait, il n'y aurait rien pour alimenter un tel modèle.
Ce que cela signifie
Les LLM à un quadrillion de paramètres ne sont pas une question de temps et de financement, mais une question de contraintes fondamentales : la physique des semi-conducteurs, le volume des données existantes et les rendements décroissants du scaling. Le progrès du secteur ne va pas vers « un modèle énorme unique », mais vers des architectures plus efficaces — Mixture of Experts, Retrieval-Augmented Generation et des systèmes agentiques spécialisés.
Questions fréquentes
Quelle est la taille du plus grand LLM ouvert aujourd'hui ?
En 2026, le plus grand modèle entièrement ouvert reste Grok-1 de xAI — 314 milliards de paramètres dans une architecture Mixture of Experts, publié en accès ouvert en mars 2024. Les modèles frontier fermés des grands laboratoires, selon les estimations des analystes de SemiAnalysis, dépassent 1 trillion de paramètres.
Les ordinateurs quantiques aideront-ils à entraîner de tels modèles ?
Les ordinateurs quantiques sont efficaces pour une classe étroite de tâches — la factorisation et la simulation moléculaire —, mais pas pour la multiplication matricielle, sur laquelle repose l'entraînement des transformers. Dans un avenir prévisible, les systèmes quantiques ne remplaceront pas les GPU et TPU dans les tâches d'entraînement des LLM.
*Meta est reconnue comme organisation extrémiste et est interdite en Russie.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.