LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.
معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
Модели с квадриллионом параметров (10^15) не появятся в обозримом будущем — физические и вычислительные ограничения делают этот масштаб практически недостижимым в нынешней парадигме.
Насколько далеко до квадриллиона сейчас?
До заветной цифры — в тысячу раз дальше, чем кажется. Лучшие языковые модели 2025–2026 годов работают в диапазоне от сотен миллиардов до нескольких триллионов параметров. По оценкам аналитиков SemiAnalysis, GPT-4 построен на архитектуре Mixture of Experts с суммарным числом весов около 1,76 трлн; Gemini Ultra от Google — порядка 1,56 трлн. До квадриллиона (10^15) нужно вырасти ещё примерно в 700–1000 раз.
- Диапазон frontier-моделей сегодня: ~100 млрд — ~2 трлн параметров
- Квадриллион (10^15) в 700–1000 раз превышает объём GPT-4
- Обучение GPT-4, по оценкам аналитиков, обошлось свыше $100 млн
- Обучение Llama 2 70B, согласно технической документации Meta, потребовало ~539 МВт·ч
- Только хранение весов 1Q-модели в формате int4 займёт около 125 ТБ
Почему 1000-кратный рост — это не просто «подождать»?
Квадриллионная модель требует не просто больше денег — она требует принципиально иной физики.
Флагманские GPU NVIDIA H100/H200 хранят 80–192 ГБ памяти на карту. Даже в агрессивном 1-битном квантовании 1Q-модели понадобится ~125 ТБ только под веса — без активаций, градиентов и оптимизатора. В стандартном формате BF16 это уже ~2 петабайта. Такой объём требует строительства принципиально иной инфраструктуры, которой не существует ни у одной компании в мире.
«Мы видим замедление отдачи от чистого масштабирования числа параметров — данные и вычислительная эффективность важнее сырого размера», — согласно исследовательским публикациям команды
DeepMind по Chinchilla-оптимизации.
К физике добавляется энергопотребление. Оценочно, обучение 1Q-модели при нынешней эффективности чипов потребует от десятков до сотен ТВт·ч — это сравнимо с годовым потреблением электроэнергии средней европейской страны.
Почему данных на квадриллион не хватит?
По данным исследования DeepMind (Hoffmann et al., 2022), для compute-оптимального обучения модель нужно тренировать примерно на 20 токенах на каждый параметр. Следовательно, 1Q-модели необходимо обучиться на 20 квадриллионов токенов. По различным исследовательским оценкам, весь оцифрованный текст интернета составляет порядка 10^13–10^14 токенов — в 200–2000 раз меньше нужного.
Синтетические данные частично снимают ограничение, но не в тысячекратном масштабе и не без деградации качества при зацикленной генерации. Иными словами, даже если бы вычислительная инфраструктура существовала — кормить такую модель было бы нечем.
Что это значит
Квадриллионные LLM — не вопрос времени и финансирования, а вопрос фундаментальных ограничений: физики полупроводников, объёма существующих данных и убывающей отдачи от масштабирования. Прогресс отрасли движется не к «одной огромной модели», а к более эффективным архитектурам — Mixture of Experts, Retrieval-Augmented Generation и специализированным агентным системам.
Частые вопросы
Какой размер у самой большой открытой LLM сегодня?
По состоянию на 2026 год крупнейшей полностью открытой моделью остаётся Grok-1 от xAI — 314 млрд параметров в архитектуре Mixture of Experts, выпущенная в открытый доступ в марте 2024 года. Закрытые frontier-модели крупных лабораторий, по оценкам аналитиков SemiAnalysis, превышают 1 трлн параметров.
Поможет ли квантовый компьютер в обучении таких моделей?
Квантовые компьютеры эффективны для узкого класса задач — факторизации и симуляции молекул, — но не для матричного умножения, на котором строится обучение трансформеров. В обозримой перспективе квантовые системы не заменят GPU и TPU в задачах обучения LLM.
*Meta признана экстремистской организацией и запрещена в РФ.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.