Habr AI→ المصدر

LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»

На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

لن تظهر النماذج التي تحتوي على كوادريليون معامل (10^15) في المستقبل المنظور — إذ تجعل القيود الفيزيائية والحسابية هذا الحجم بعيد المنال عملياً في النموذج الحالي.

كم يبعد الكوادريليون عنا اليوم؟

نحن أبعد بألف مرة عن هذا الرقم المنشود مما يبدو. تعمل أفضل نماذج اللغة في الفترة 2025–2026 في نطاق يتراوح بين مئات المليارات وعدة تريليونات من المعاملات. وفقاً لمحللي SemiAnalysis، يُبنى GPT-4 على معمارية Mixture of Experts بإجمالي أوزان يبلغ نحو 1.76 تريليون؛ أما Gemini Ultra من Google فيبلغ نحو 1.56 تريليون. للوصول إلى كوادريليون (10^15)، يلزم النمو بمقدار 700 إلى 1000 مرة إضافية.

  • نطاق نماذج الحدود اليوم: ~100 مليار — ~2 تريليون معامل
  • الكوادريليون (10^15) يتجاوز حجم GPT-4 بمقدار 700–1000 مرة
  • تكلّف تدريب GPT-4، وفق تقديرات المحللين، أكثر من 100 مليون دولار
  • استلزم تدريب Llama 2 70B، وفق الوثائق التقنية لـ Meta، نحو 539 ميغاواط/ساعة
  • مجرد تخزين أوزان نموذج 1Q بتنسيق int4 سيشغل نحو 125 تيرابايت

لماذا النمو بمقدار 1000 مرة ليس مجرد مسألة "انتظار"؟

لا يستلزم نموذج الكوادريليون معاملاً مزيداً من المال فحسب، بل يستلزم فيزياء مختلفة جذرياً.

تتسع وحدات معالجة الرسومات الرائدة من NVIDIA H100/H200 من 80 إلى 192 جيجابايت من الذاكرة لكل بطاقة. حتى مع الكمية العدوانية بمقدار 1 بت، سيحتاج نموذج 1Q إلى نحو 125 تيرابايت للأوزان وحدها — دون احتساب التنشيطات والتدرجات والمحسِّن. بتنسيق BF16 القياسي، يبلغ ذلك بالفعل نحو 2 بيتابايت. يستوجب هذا الحجم بناء بنية تحتية مختلفة جذرياً لا تمتلكها أي شركة في العالم حالياً.

«نلاحظ تناقصاً في عائدات التوسع الصرف في عدد المعاملات — البيانات والكفاءة الحسابية أهم من الحجم الخام»، وفقاً للمنشورات البحثية لفريق

DeepMind حول تحسين Chinchilla.

يُضاف إلى المشكلة الفيزيائية استهلاك الطاقة. تشير التقديرات إلى أن تدريب نموذج 1Q بالكفاءة الحالية للشرائح سيستلزم عشرات إلى مئات التيراواط/ساعة — ما يعادل الاستهلاك السنوي للكهرباء في دولة أوروبية متوسطة.

لماذا البيانات لن تكفي لتدريب الكوادريليون؟

وفقاً لأبحاث DeepMind (Hoffmann et al., 2022)، للتدريب الأمثل حسابياً، يحتاج النموذج إلى التدريب على نحو 20 رمزاً لكل معامل. وبالتالي، يحتاج نموذج 1Q إلى التدريب على 20 كوادريليون رمز. وفق تقديرات بحثية متعددة، يبلغ إجمالي النصوص الرقمية على الإنترنت نحو 10^13–10^14 رمز — أي أقل بمقدار 200 إلى 2000 مرة مما هو مطلوب.

تُخفف البيانات الاصطناعية القيد جزئياً، لكن ليس بمقياس يبلغ ألف مرة وليس دون تدهور في الجودة عند التوليد الحلقي. بمعنى آخر، حتى لو وُجدت البنية التحتية الحسابية، لما كان ثمة ما يُغذي مثل هذا النموذج.

ماذا يعني هذا؟

إن نماذج LLM بحجم كوادريليون ليست مسألة وقت وتمويل، بل مسألة قيود جوهرية: فيزياء أشباه الموصلات، وحجم البيانات الموجودة، وتناقص عائدات التوسع. لا يسير تقدم الصناعة نحو «نموذج ضخم واحد»، بل نحو معماريات أكثر كفاءة — Mixture of Experts، وRetrieval-Augmented Generation، والأنظمة العاملة المتخصصة.

الأسئلة الشائعة

ما حجم أكبر نموذج LLM مفتوح اليوم؟

اعتباراً من عام 2026، يبقى Grok-1 من xAI أكبر نموذج مفتوح بالكامل — 314 مليار معامل في معمارية Mixture of Experts، أُصدر للعموم في مارس 2024. أما نماذج الحدود المغلقة للمختبرات الكبرى، وفق تقديرات محللي SemiAnalysis، فتتجاوز تريليون معامل.

هل ستساعد أجهزة الحوسبة الكمية في تدريب هذه النماذج؟

تعمل أجهزة الحوسبة الكمية بكفاءة على فئة ضيقة من المهام — التحليل إلى عوامل ومحاكاة الجزيئات — لكن ليس على ضرب المصفوفات الذي يُبنى عليه تدريب المحوِّلات (transformers). في المستقبل المنظور، لن تحل الأنظمة الكمية محل وحدات GPU وTPU في مهام تدريب LLM.

*تُعترف Meta بوصفها منظمة متطرفة وهي محظورة في روسيا.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…