Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.
معالج بواسطة الذكاء الاصطناعي من Hugging Face Blog؛ بتحرير Hamidun News
في 23 يوليو 2026، أطلقت HuggingFace أداة NunchakuLite، وهي تكامل أصلي للاستدلال بدقة 4 بت لنماذج الانتشار (diffusion) ضمن مكتبة Diffusers، يقلّل استهلاك ذاكرة الفيديو حتى 50% ويسرّع توليد الصور بنحو 30%.
ما هي Nunchaku و SVDQuant
Nunchaku هو محرك استدلال يعمل بتقنية CUDA وينفّذ طريقة التكميم SVDQuant لمحولات الانتشار (diffusion transformers). تكامل NunchakuLite هو الأول الذي ينقل هذه التقنية مباشرة إلى Diffusers: يتم تحميل النموذج عبر الدالة المعتادة `from_pretrained()`، دون الحاجة إلى pipeline منفصل أو تجميع يدوي، ويتم تنزيل نوى CUDA اللازمة تلقائيًا عبر حزمة `kernels` عند أول تشغيل.
الفرق الجوهري بين Nunchaku ومعظم الأطر الخلفية هو وضع W4A4: حيث تُضغط الأوزان والتنشيطات (activations) معًا إلى 4 بت. الطرق المعتادة من نوع weight-only تقلّل الذاكرة لكنها لا تسرّع الحساب؛ أما هنا فتتسارع حلقة إزالة الضوضاء (denoising) نفسها.
«تنقل SVDQuant القيم الشاذة في التنشيطات إلى الأوزان، وتمثّل الجزء
الأثقل من كل مصفوفة أوزان بفرع صغير منخفض الرتبة (low-rank) بدقة 16 بت، بينما تُكمَّم البقية المتبقية إلى 4 بت»، بحسب المدونة التقنية لشركة HuggingFace.
تستند طريقة SVDQuant إلى ورقة بحثية نُشرت في نوفمبر 2024 على arXiv من قبل فريق MIT HAN Lab. بالنسبة للطبقات الثقيلة (attention و MLP)، تعمل نواة `svdq_w4a4` مع تصحيح منخفض الرتبة، أما طبقات التعديل (modulation) فتستخدم `awq_w4a16` بأوزان 4 بت وتنشيطات 16 بت.
إلى أي مدى تتسارع عملية التوليد
على بطاقة الرسوميات RTX PRO 6000 وبدقة 1024×1024، تقدّم NunchakuLite تحسنًا قابلًا للقياس في جميع المقاييس. يستغرق التشغيل الأساسي بصيغة BF16 مدة 3,00 ثانية ويستهلك 31,1 غيغابايت من ذاكرة الفيديو؛ أما بصيغة NVFP4 فتنخفض المدة إلى 2,27 ثانية والذاكرة إلى 20,6 غيغابايت.
- BF16 (المرجع): 3,00 ثانية، 31,1 غيغابايت ذاكرة — تسريع 1,0x
- NVFP4: 2,27 ثانية، 20,6 غيغابايت — تسريع 1,35x
- NVFP4 + torch.compile: 1,68 ثانية، 20,6 غيغابايت — تسريع 1,8x
- NVFP4 + مُرمِّز نصي NF4: 2,29 ثانية، 16,0 غيغابايت ذاكرة
- نموذج ERNIE-Image-Turbo: 1024×1024 في نحو 1,7 ثانية على RTX 5090 (نحو 12 غيغابايت مقابل نحو 24 غيغابايت بصيغة BF16)
الجمع مع `torch.compile` يرفع سرعة التوليد حتى 1,8 مرة، واستبدال مُرمِّز النص بـ NF4 يخفض ذروة استهلاك الذاكرة إلى 16,0 غيغابايت — وهو ما يكفي لتشغيل النماذج الثقيلة على بطاقات المستهلكين.
ما العتاد والنماذج المدعومة
تعمل NunchakuLite على معظم بطاقات NVIDIA الحديثة، لكن مخطط التكميم يعتمد على المعمارية. تتطلب صيغة NVFP4 عبر نواة `svdq_w4a4` معمارية Blackwell (RTX 50، RTX PRO 6000، B200)، بينما تُستخدم INT4 على معماريات Turing وAmpere وAda (RTX 30/40، A100، L40S). معماريتا Volta وHopper غير مدعومتين — إذ يُصدر المُدقِّق فورًا خطأً واضحًا عند التحميل.
نُشرت بالفعل نماذج جاهزة للتشغيل ضمن منظمة lite-infer على HuggingFace Hub: ERNIE-Image-Turbo (بنسختي INT4 وNVFP4)، وKrea 2 Turbo (NVFP4)، وFLUX.2 Klein 4B. أما بالنسبة للتكميم المخصص، فقد أصدر الفريق أداة diffuse-compressor: تقوم بفحص النموذج، وإجراء معايرة SVDQuant، وتجميع pipeline خاص بـ Diffusers، ونشر النتيجة على Hub.
ما الذي يعنيه هذا
لم يعد الاستدلال بدقة 4 بت حكرًا على فروع (forks) منفصلة، بل بات جزءًا من المكتبة الرئيسية لتوليد الصور. يحصل المطورون على نصف استهلاك VRAM وتسريع ملحوظ عمليًا بسطر برمجي واحد فقط — ما يجعل نماذج الانتشار الرائدة متاحة على بطاقات الرسوميات العادية المخصصة للألعاب.
الأسئلة الشائعة
على أي بطاقات رسوميات تعمل NunchakuLite؟
تتطلب صيغة NVFP4 بطاقات Blackwell — RTX 50 أو RTX PRO 6000 أو B200. أما على RTX 30/40 وA100 وL40S فيعمل مخطط INT4. معماريتا Volta وHopper غير مدعومتين إطلاقًا.
كم تقل الحاجة إلى ذاكرة الفيديو؟
على RTX PRO 6000، تنخفض ذروة VRAM من 31,1 غيغابايت بصيغة BF16 إلى 20,6 غيغابايت بصيغة NVFP4، ومع مُرمِّز النص NF4 تنخفض إلى 16,0 غيغابايت، أي بمقدار النصف تقريبًا.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.