DeLS-Spec يسرّع استدلال نماذج اللغة دون إعادة تدريب
تسرّع طريقة DeLS-Spec الجديدة توليد النصوص لنماذج اللغة الكبيرة. ميزته الرئيسية: محول خفيف الوزن يتم تدريبه بشكل مستقل عن النموذج، دون إعادة تدريب النموذج. أظهرت الاختبارات على نماذج Qwen3 تحسنّات في السرعة لمهام الرياضيات والأكواد والحوار.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
اقترح الباحثون DeLS-Spec—طريقة جديدة لتسريع إنشاء النصوص في نماذج اللغة. يسمح النهج لأول مرة بتحقيق تسريع كبير دون الحاجة إلى إعادة تدريب النماذج نفسها، مما يقلل بشكل كبير من العوائق أمام تبني مثل هذه التحسينات.
كيفية عمل فك التشفير التخميني
فك التشفير التخميني هو تقنية تسرع استدلال LLM من خلال إنشاء عدة رموز بالتوازي بدلاً من واحد تلو الآخر. يتنبأ نموذج مسودة صغير برموز مرشحة، والنموذج الرئيسي يتحقق من صحتها في تمريرة واحدة. إذا تطابقت التنبؤ—يتم قبول الرموز، وإلا يتكرر العملية.
طرق أكثر تقدمًا، مثل DFlash، تنشئ كتلة كاملة من الرموز في تمريرة واحدة، مما يسرع العملية بشكل أكبر. لكن هذا يخلق مشكلة: عادة ما يتم التنبؤ برموز داخل الكتلة بشكل مستقل، دون مراعاة التبعيات السببية بينها.
المشكلة مع الطرق الموجودة
حاولت طرق حديثة أخرى، مثل Domino و DSpark، إضافة السببية إلى رسم الكتلة المتوازية—لحساب التبعيات بين الرموز في الكتلة. لكن هذا يتطلب تدريب المسودة من الصفر، وهو أمر مكلف ويتطلب موارد حسابية ضخمة. لا تستطيع المنظمات الخالية من بيتابايت من البيانات وعناقيد GPU الضخمة تحمل إعادة التدريب هذه.
ما الجديد في DeLS-Spec
يحل DeLS-Spec هذه المشكلة من خلال تقسيم الأدوار بين خبراء اثنين. تستخدم الطريقة نموذج DFlash الموجود كـ "خبير السياق الطويل" وتضيف رأس محلي خفيف الوزن كـ "خبير السياق القصير".
الميزة الرئيسية: يمكن تدريب الرأس المحلي بشكل مستقل تمامًا، دون التدريب المشترك مع النموذج الرئيسي أو عمود الفقري لـ DFlash. هذا يقلل بشكل كبير من التكاليف الحسابية. الرأس المحلي هو شبكة صغيرة تنظر فقط إلى السياقات الأخيرة وتتعلم التنبؤ برموز مع مراعاة التبعيات السببية.
- الطريقة المطبقة على نماذج Qwen3
- يتطلب التدريب تكاليف دنيا—يتم تدريب محول خفيف الوزن فقط
- عند الاستدلال، يتم الجمع بين logits من خبراء اثنين
- الرأس المحلي مستقل عن أي إصدار نقطة فحص محددة لـ DFlash
- تحسن في كل من سرعة التنفيذ وطول الرموز المقبولة على المقاييس
نتائج الاختبار
على معايير Qwen3، أظهر DeLS-Spec تحسنًا في كل من سرعة التنفيذ (speedup) والطول المتوسط للرموز المقبولة (average acceptance length) مقارنة بـ DFlash. هذا صحيح بالنسبة لثلاث فئات من المهام: الرياضيات والبرمجة وأنظمة الحوار.
لماذا هذا مهم: تعني السلاسل الأطول من الرموز المقبولة أن المسودة تتنبأ بشكل أكثر دقة وأن النظام يمكنه إنشاء المزيد من النصوص في تكرار واحد، مما يؤثر مباشرة على الإنتاجية.
لماذا هذا مهم للصناعة
تسريع استدلال LLM ليس فقط مسألة سرعة، بل اقتصاد. من الأرخص تدريب محول صغير من إعادة تدريب مسودة كاملة أو نموذج أساسي. هذا يجعل طرق التحسين في متناول المنظمات التي ليس لديها موارد لإعادة التدريب على نطاق واسع.
مع أن نماذج اللغة الكبيرة تصبح أكثر تعقيدًا وكثافة في استهلاك الطاقة، فإن هذه التحسينات الإضافية في كفاءة الاستدلال تتراكم وتتحول إلى مكاسب كبيرة في السرعة والتكلفة. يوضح DeLS-Spec اتجاهًا مهمًا: غالبًا ما يتم تحقيق أفضل النتائج ليس من خلال إعادة تدريب النماذج الكبيرة، بل من خلال الجمع الأنيق للمكونات الموجودة.
ما يعنيه هذا
هذا النهج يفتح طرقًا لتحسين LLM أكثر سهولة في المنظمات من جميع الأحجام، مما يمكّن حتى الفرق الصغيرة من تحقيق التسريع بدون ميزانيات حسابية ضخمة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.