arXiv cs.CL→ المصدر

MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов

Исследователи представили MultiMDM — диффузионную языковую модель с несколькими масками. В отличие от обычных masked diffusion моделей, где все траектории схлопываются в одно замаскированное состояние, MultiMDM сохраняет структуру маскирования и генерирует текст за небольшое число шагов. Модель можно дообучать поверх уже готовых MDM, а не тренировать с нуля.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов
المصدر: arXiv cs.CL. كولاج: Hamidun News.
◐ استمع للمقال

قدّم باحثون نموذج MultiMDM (multi-mask diffusion model) — وهو نموذج لغوي انتشاري (diffusion) يستخدم عدة أقنعة (masks) بدلاً من قناع واحد، وبفضل ذلك يولّد النص خلال عدد قليل من الخطوات دون فقدان في الجودة. نُشرت النسخة الأولية (preprint) على arXiv في قسم cs.CL في يوليو 2026.

لماذا يتعثر التوليد بخطوات قليلة (few-step)

تعمل نماذج الانتشار المقنّع المعتادة (masked diffusion models، أو MDM) بشكل ضعيف في نمط few-step، لأن كل مساراتها الأمامية (forward) تنهار إلى حالة واحدة مقنّعة بالكامل. عند هذه النقطة لا تبقى أي "إنتروبيا متبقية" (residual entropy) تعتمد عليها مناهج consistency لتوليد النص خلال عدد قليل من الخطوات — فلا يجد النموذج ببساطة ما يتشبث به.

البديل في صورة uniform-state diffusion يتجنّب هذا التدهور، لكنه يدفع ثمناً آخر: إذ يصبح من الأصعب هناك التمييز بين الرموز (tokens) النظيفة والضوضاء. وبحسب arXiv، عادةً ما يضرّ هذا بجودة التوليد وبكفاءة التدريب في آن واحد. يحلّ MultiMDM المشكلتين معاً، مع البقاء داخل نموذج "التقنيع" (masked paradigm).

السرعة هنا ليست أمراً تجميلياً: فكلما قلّ عدد الخطوات، كان الاستدلال (inference) أرخص وأسرع، لذا فإن نمط few-step هو مفتاح الجدوى العملية لنماذج اللغة الانتشارية (diffusion LLMs).

ما الذي يقترحه MultiMDM

يحافظ MultiMDM على بنية التقنيع، لكنه يُدخل مجموعة من عدة أقنعة بدلاً من قناع واحد. ففي العملية الأمامية (forward)، يُدفع كل رمز (token) نظيف أولاً نحو قناعه المخصَّص له، ثم يُخلط تدريجياً عبر مجموعة الأقنعة بأكملها.

ونتيجة لذلك، تكتسب العملية العكسية (backward) القدرة على "المسودة" (drafting): يتنبأ النموذج أولاً بالقناع المخصَّص، ثم يُنقّحه لاحقاً وصولاً إلى الرمز النظيف. وهذه الحركة ذات المرحلتين بالتحديد هي ما يسمح بالاكتفاء بعدد قليل من الخطوات.

وخلافاً للقناع الواحد في نماذج MDM الكلاسيكية، تترك مجموعة الأقنعة للنموذج "هامش مناورة" — وهو بالضبط الإنتروبيا المتبقية التي كانت تنقص نمط few-step.

  • النموذج — MultiMDM (multi-mask diffusion model)، نسخة أولية (preprint) على arXiv (cs.CL)، يوليو 2026
  • الفكرة الأساسية — عدة أقنعة بدلاً من قناع واحد، للحفاظ على بنية التقنيع أثناء التوليد بخطوات قليلة (few-step)
  • تعمل العملية العكسية (backward) على مرحلتين: أولاً مسودة (التنبؤ بالقناع)، ثم تنقيح وصولاً إلى الرمز النظيف
  • التدريب — دالة ELBO بصيغة مغلقة (closed-form)، تتيح continual training فوق نماذج MDM المدرَّبة مسبقاً
  • التقطير (Distillation) — عبارة عن consistency distillation قائم بالكامل على الحالات المنفصلة (discrete-state) مع اقتران shared-Gumbel coupling

كيف يُدرَّب هذا النموذج

توصّل الباحثون إلى صيغة ELBO مغلقة (closed-form) — وهي هدف تدريب بصيغة مغلقة تتيح عدم تدريب MultiMDM من الصفر، بل مواصلة تدريبه فوق نماذج MDM جاهزة ومدرَّبة مسبقاً. وهذا يخفّض بشكل ملحوظ تكلفة الدخول: إذ تصبح النماذج القائمة نقطة انطلاق.

أما المكوّن الثاني فهو consistency distillation قائم بالكامل على الحالات المنفصلة (discrete-state) مع اقتران shared-Gumbel coupling، يقلّل من الإنتروبيا على مسار التوليد (pathwise entropy). والتقطير ضروري تحديداً من أجل "ضغط" التوليد متعدد الخطوات إلى خطوات قليلة، مع الحفاظ على الجودة.

"يوفّر

MultiMDM أساساً فعّالاً لتوليد النص بخطوات قليلة وبطريقة مبدئية (principled)"، كما جاء في ملخص الورقة البحثية على arXiv.

ما الذي يعنيه هذا

تُعدّ نماذج اللغة الانتشارية (diffusion) البديل الرئيسي للنماذج التلقائية الانحدار (autoregressive) المعتادة، التي تكتب النص حرفياً رمزاً (token) تلو الآخر. فالانتشار قادر على توليد المقطع بأكمله دفعة واحدة ثم تنقيحه عبر عدة تمريرات، ويمثّل MultiMDM خطوة نحو القيام بذلك بسرعة ودون تراجع في الجودة، بالاعتماد على نماذج مدرَّبة بالفعل.

الأسئلة الشائعة

بم يختلف MultiMDM عن نماذج الانتشار المقنّع المعتادة؟

يستخدم MultiMDM ليس قناعاً واحداً بل مجموعة كاملة من الأقنعة. وهذا يحافظ على بنية "التقنيع" ويمنح العملية العكسية القدرة على المسودة — التنبؤ بالقناع أولاً، ثم تنقيح الرمز لاحقاً — وهي قدرة تفتقر إليها نماذج MDM الكلاسيكية بحالتها الوحيدة المقنّعة بالكامل.

هل يحتاج MultiMDM إلى التدريب من الصفر؟

لا. فبحسب arXiv، تتيح صيغة ELBO المغلقة إجراء continual training فوق نماذج MDM المدرَّبة مسبقاً، أي استخدام النماذج القائمة كنقطة انطلاق بدلاً من تدريب نموذج جديد من صفحة بيضاء تماماً.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…