LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.
AI-обработка оригинала Habr AI; редакция Hamidun News
Модели с квадриллионом параметров (10^15) не появятся в обозримом будущем — физические и вычислительные ограничения делают этот масштаб практически недостижимым в нынешней парадигме.
Насколько далеко до квадриллиона сейчас?
До заветной цифры — в тысячу раз дальше, чем кажется. Лучшие языковые модели 2025–2026 годов работают в диапазоне от сотен миллиардов до нескольких триллионов параметров. По оценкам аналитиков SemiAnalysis, GPT-4 построен на архитектуре Mixture of Experts с суммарным числом весов около 1,76 трлн; Gemini Ultra от Google — порядка 1,56 трлн. До квадриллиона (10^15) нужно вырасти ещё примерно в 700–1000 раз.
- Диапазон frontier-моделей сегодня: ~100 млрд — ~2 трлн параметров
- Квадриллион (10^15) в 700–1000 раз превышает объём GPT-4
- Обучение GPT-4, по оценкам аналитиков, обошлось свыше $100 млн
- Обучение Llama 2 70B, согласно технической документации Meta, потребовало ~539 МВт·ч
- Только хранение весов 1Q-модели в формате int4 займёт около 125 ТБ
Почему 1000-кратный рост — это не просто «подождать»?
Квадриллионная модель требует не просто больше денег — она требует принципиально иной физики.
Флагманские GPU NVIDIA H100/H200 хранят 80–192 ГБ памяти на карту. Даже в агрессивном 1-битном квантовании 1Q-модели понадобится ~125 ТБ только под веса — без активаций, градиентов и оптимизатора. В стандартном формате BF16 это уже ~2 петабайта. Такой объём требует строительства принципиально иной инфраструктуры, которой не существует ни у одной компании в мире.
«Мы видим замедление отдачи от чистого масштабирования числа параметров — данные и вычислительная эффективность важнее сырого размера», — согласно исследовательским публикациям команды
DeepMind по Chinchilla-оптимизации.
К физике добавляется энергопотребление. Оценочно, обучение 1Q-модели при нынешней эффективности чипов потребует от десятков до сотен ТВт·ч — это сравнимо с годовым потреблением электроэнергии средней европейской страны.
Почему данных на квадриллион не хватит?
По данным исследования DeepMind (Hoffmann et al., 2022), для compute-оптимального обучения модель нужно тренировать примерно на 20 токенах на каждый параметр. Следовательно, 1Q-модели необходимо обучиться на 20 квадриллионов токенов. По различным исследовательским оценкам, весь оцифрованный текст интернета составляет порядка 10^13–10^14 токенов — в 200–2000 раз меньше нужного.
Синтетические данные частично снимают ограничение, но не в тысячекратном масштабе и не без деградации качества при зацикленной генерации. Иными словами, даже если бы вычислительная инфраструктура существовала — кормить такую модель было бы нечем.
Что это значит
Квадриллионные LLM — не вопрос времени и финансирования, а вопрос фундаментальных ограничений: физики полупроводников, объёма существующих данных и убывающей отдачи от масштабирования. Прогресс отрасли движется не к «одной огромной модели», а к более эффективным архитектурам — Mixture of Experts, Retrieval-Augmented Generation и специализированным агентным системам.
Частые вопросы
Какой размер у самой большой открытой LLM сегодня?
По состоянию на 2026 год крупнейшей полностью открытой моделью остаётся Grok-1 от xAI — 314 млрд параметров в архитектуре Mixture of Experts, выпущенная в открытый доступ в марте 2024 года. Закрытые frontier-модели крупных лабораторий, по оценкам аналитиков SemiAnalysis, превышают 1 трлн параметров.
Поможет ли квантовый компьютер в обучении таких моделей?
Квантовые компьютеры эффективны для узкого класса задач — факторизации и симуляции молекул, — но не для матричного умножения, на котором строится обучение трансформеров. В обозримой перспективе квантовые системы не заменят GPU и TPU в задачах обучения LLM.
*Meta признана экстремистской организацией и запрещена в РФ.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.