النماذج

نموذج الانتشار (Diffusion Model)

نموذج الانتشار هو نظام ذكاء اصطناعي توليدي ينتج صوراً أو صوتاً أو فيديو بتعلم عكس عملية إضافة ضوضاء تكرارية، بدءاً من ضوضاء عشوائية والإزالة التدريجية للضوضاء من خلال خطوات متعلمة لإنتاج مخرجات منسجمة.

نموذج الانتشار هو فئة من النماذج التوليدية التي تتعلم توزيع البيانات الحقيقية—الأكثر شيوعاً الصور—بالتدريب على الاستسلام لعملية عشوائية تدريجياً تفسد البيانات النظيفة إلى ضوضاء خالصة. ينبع النهج من الثرموديناميكا الإحصائية غير الاتزانية وتم تشكيله رسمياً للتعلم العميق في ورقة Denoising Diffusion Probabilistic Models (DDPM) من قبل Ho وآخرين في 2020. تستند نماذج الانتشار الآن إلى معظم أنظمة توليد الصور الرائدة: Stable Diffusion من Stability AI و DALL-E 3 من OpenAI و Imagen و Imagen 3 من Google و Adobe Firefly جميعها تعتمد على الانتشار أو نمذجة توليدية مستندة على الدرجة وثيقة الصلة.

يتضمن التدريب عمليتين. تأخذ العملية الأمامية عينة بيانات نظيفة وتضيف كميات صغيرة من ضوضاء غاوسية على مراحل T (غالباً 1,000 أو أكثر)، مما ينتج تسلسل من الصورة الأصلية إلى ضوضاء خالصة؛ هذه العملية ثابتة ولا تتطلب معاملات متعلمة. العملية العكسية هي ما تتعلمه الشبكة العصبية: في ضوء عينة صاخبة في خطوة t ومستوى الضوضاء، تنبأ بالضوضاء التي تم إضافتها، مما يسمح بطرحها. عند الاستدلال، يبدأ النموذج من ضوضاء غاوسية عشوائية ويطبق تكراراً هذه خطوة الإزالة الضوضاء لإنتاج عينة من التوزيع البيانات المتعلمة. يتم تحقيق التوليد المشروط على النصوص عن طريق الانتباه الأمامي لتضمينات النصوص (من CLIP أو T5)، والتوجيه الخالي من المصنف يعزز الالتزام بموجهة النصوص على حساب التنوع. قللت طرق أخذ العينات المسرعة—DDIM و DPM-Solver و flow matching—خطوات الإزالة الضوضاء المطلوبة من الآلاف إلى العشرات، أو حتى خطوة واحدة مع تقطير الاتساق.

حلت نماذج الانتشار محل الشبكات العدائية التوليدية (GANs) كنموذج توليد الصور السائد بعد 2022. تتطلب GANs توازن تدريب عدائي دقيق بين المولد والمحتقد، تعاني من انهيار الوضع، وصعب الحجم. تتدرب نماذج الانتشار مع هدف إزالة ضوضاء بسيط، وتكون مستقرة للتحسين، وتنتج عينات متنوعة عالية الجودة، وتتوسع بشكل متنبأ به مع حجم النموذج والبيانات. أثار الإصدار العام لـ Stable Diffusion 1.x في أغسطس 2022، الذي سمح بتشغيل توليد الصور على وحدات معالجة الرسومات الاستهلاكية، اعتماد سريع وانفجار المنتجات والبحث اللاحق.

اعتباراً من 2026، تبقى نماذج الانتشار والنماذج المتطابقة الدقيقة الركيزة الأساسية للصور التجارية وتوليد الفيديو. يوفر Flow matching—المستخدم في Stable Diffusion 3 و نماذج FLUX من Black Forest Labs وعدة منشئات فيديو—هدف تدريب أنظف رياضياً واستدلال أسرع من DDPM، ويفضل بشكل متزايد في الأنظمة الجديدة. تمدد نماذج انتشار الفيديو، بما فيها Sora من OpenAI (معلن في فبراير 2024) و Veo من Google، البنية إلى الاتساق الزماني عبر الإطارات. بعيداً عن الرسومات، يتم تطبيق أساليب قائمة على الانتشار على تركيب الكلام (Google's AudioLM و Meta's Voicebox) وتصميم الجزيئات، حيث تولد نماذج من Schrödinger و Insilico Medicine جزيئات الأدوية المرشحة بإزالة الضوضاء في الفضاء الإحداثي ثلاثي الأبعاد.

مثال

يكتب مصمم رسومات موجهة نصية في Adobe Firefly؛ نموذج الانتشار يبدأ من ضوضاء عشوائية ويطبق عدة مئات من خطوات الإزالة الموجهة بتضمين النص الخاص بالموجهة، مما ينتج صورة واقعية في ثوان قليلة.

مصطلحات مرتبطة

← المسرد