BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU
Несколько лет назад запуск 27B-модели без мощной видеокарты был невозможен. Теперь — реальность: тернарное квантование, где каждый вес принимает одно из трёх значений {-1, 0, 1}, сжимает нейросеть до ~1.58 бита на параметр. Никаких операций умножения в инференсе — только сложения и вычитания, которые вытягивает любой процессор.
معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
قبل بضع سنوات، كانت فكرة تشغيل نموذج يضمّ 27 مليار معامل على حاسوب محمول عادي دون GPU تبدو ضرباً من الجنون. وفي الفترة بين عامَي 2024 و2025، أصبح ذلك حقيقةً واقعة — بفضل التكميم غير التقليدي: بدلاً من تقريب الأوزان، تُبنى الشبكة العصبية حرفياً على قيمتين أو ثلاث قيم منفصلة.
ما هو التكميم غير التقليدي
يُخفّض التكميم المعتاد دقة الأوزان عبر التدرج: float32 → INT8 → INT4 → INT2، مع الحفاظ على نطاق رقمي متصل. أما النهج غير التقليدي فهو أكثر جذرية: لا تأخذ الأوزان إلا القيم {-1, 0, 1} — وهذا ما يُعرف بالتكميم الثلاثي. طوّرت Microsoft Research عائلة BitNet، التي يُخزَّن فيها كل وزن بمعدل 1.58 بت في المتوسط.
- BitNet — بنية بأوزان أحادية البت أثناء التدريب، اقترحتها Microsoft Research عام 2023
- BitNet b1.58 — النسخة الثلاثية بأوزان {-1, 0, 1}، بمعدل 1.58 بت لكل معامل، نُشرت في مارس 2024
- يشغل Gemma 27B بالصيغة الثلاثية 6–7 غيغابايت ويعمل على حاسوب محمول بالمعالج فقط دون GPU
- يدعم llama.cpp صيغ GGUF أحادية البت منذ مارس 2024
- تُستبدَل عمليات الضرب بعمليات الجمع والطرح — دون أي عبء على وحدات الفاصلة العائمة في المعالج
لماذا هذا ليس مثل INT4
إن التكميم الكلاسيكي INT4 هو ضغط ما بعد التدريب: يُضغَّط النموذج الجاهز بصيغة float32 بعد انتهاء التدريب، وتنخفض الجودة حتماً، لا سيما في النماذج الأصغر حجماً. أما التكميم غير التقليدي فيعمل بآلية مختلفة: تُدرَّب الشبكة من الصفر بحيث تستقر الأوزان في مواضع منفصلة. وهذا يُغيّر جوهرياً طبيعة خسائر الدقة.
«إن نموذجاً بأوزان {-1, 0, 1}، إذا دُرِّب بالشكل الصحيح، يضاهي نظيره ذا الدقة الكاملة من حيث الحيرة (perplexity)، مع الحاجة إلى ذاكرة وصول عشوائي أقل بمقدار 3 إلى 5 مرات»، كما يذكر التقرير التقني لـ
Microsoft Research حول BitNet b1.58.
وفقاً للمعايير المفتوحة، لا يتجاوز الفارق مع خط الأساس float16 في النماذج التي تبدأ من 7 مليارات معامل نسبة 1–3% في معظم المهام — وهو ثمن مقبول لإتاحة النموذج ضمن ذاكرة الوصول العشوائي لحاسوب محمول عادي.
ما الذي يعمل على الحاسوب المحمول الآن
المثال الأكثر دلالةً هو نماذج الفئة 27B على جهاز MacBook بذاكرة موحدة سعتها 32 غيغابايت، أو على حاسوب محمول يعمل بنظام Windows مع معالج عادي دون GPU منفصلة. تبلغ سرعة التوليد على Apple M2 Pro لنموذج ثلاثي بحجم 27B نحو 10–15 رمزاً في الثانية — وهو ما يكفي لمعظم المهام العملية.
ثمة تحفظ مهم: يُعطي التكميم غير التقليدي نتائجه الأفضل على النماذج المُدرَّبة من الصفر في الوضع المقابل. أما تحويل نموذج جاهز — كـ Llama 3 مثلاً — إلى الصيغة الثلاثية لاحقاً دون انخفاض ملحوظ في الجودة فأمرٌ عسير: إذ يستلزم ذلك إما ضبطاً دقيقاً إضافياً أو تقطيراً عبر نموذج معلّم ثلاثي.
ما الذي يعنيه هذا
يُزيح التكميم الثلاثي وأحادي البت حدود إمكانية الوصول: لم تعد نماذج اللغة الكاملة بحجم 27 ملياراً وما فوق تستلزم أجهزة مستوى الخوادم. وهذا أمر بالغ الأهمية في بيئات المؤسسات التي تفرض متطلبات صارمة لخصوصية البيانات — إذ يغدو الاستدلال المحلي دون الحاجة إلى السحابة ممكناً تقنياً واقتصادياً.
الأسئلة الشائعة
كيف أشغّل نموذجاً ثلاثياً دون GPU؟
تعمل النماذج الثلاثية وأحادية البت بصيغة GGUF عبر llama.cpp على معالج عادي. تكفي ذاكرة وصول عشوائي بسعة 16–32 غيغابايت للنماذج التي تتراوح بين 7 و27 مليار معامل — دون الحاجة إلى GPU.
كيف يختلف BitNet b1.58 عن تكميم INT4؟
يُدرَّب BitNet b1.58 بأوزان ثلاثية من البداية، بدلاً من الحصول عليها نتيجة ضغط ما بعد التدريب. يمنح ذلك جودةً أكثر قابليةً للتنبؤ، ويُلغي بالكامل عمليات الضرب من مرحلة الاستدلال.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.