MarkTechPost→ المصدر

Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding

Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

في 30 يوليو 2026، أتاحت شركة Tencent الكود المصدري لإطار العمل AngelSpec — وهو إطار عمل torch-native لتدريب النماذج المسودة (draft) الخاصة بتقنية speculative decoding، والذي رفع على نماذج Hy3 متوسط معدل قبول الرموز (tokens) المقترحة من 52,8% إلى 66,4% دون أي فقدان في جودة التوليد.

ما هو speculative decoding

speculative decoding هو أسلوب لتسريع توليد النص في نموذج لغوي كبير دون فقدان جودة الإجابة. يقترح نموذج مسودة خفيف عدة رموز مستقبلية دفعة واحدة، بينما يتحقق النموذج الرئيسي (target) منها جميعًا في تمريرة واحدة عبر rejection sampling. الطريقة lossless: النص النهائي يطابق تمامًا ما كان سيولّده النموذج الرئيسي بمفرده. تعتمد سرعة التسريع على أمرين — عدد رموز المسودة المقبولة، ومدة الدورة الكاملة لـ«المسودة — التحقق».

  • تاريخ الإصدار — 30 يوليو 2026، برخصة مفتوحة المصدر
  • إطار عمل torch-native، يعمل على نماذج عائلة Hy3
  • يغطي منهجين: MTP التلقائي الانحدار (autoregressive) وعائلة block-parallel المسماة DFlash (DFly، D-cut)
  • متوسط معدل قبول الرموز: 52,8% ← 66,4% عند T=0
  • متوسط طول المسودة المقبولة: 2,58 ← 2,99 رمزًا

لماذا يخسر النموذج الموحد الواحد

يخسر نموذج المسودة الموحد الواحد لأن حركة المرور الفعلية غير متجانسة، ولأن مقياسي السرعة يتجاذبان في اتجاهين متعاكسين. ففي الحوار المفتوح ذي الإنتروبيا العالية، تكون عشرات الاستكمالات مقبولة، لذا ينخفض معدل القبول بسرعة مع عمق الاقتراح — أي أن توليد كتلة طويلة غير مجدٍ. أما الكود والرياضيات فيتصرفان بشكل مختلف: فالصياغة النحوية والمعرّفات المتكررة والاشتقاقات خطوة بخطوة تقيّد الرموز المستقبلية بشكل أقوى بكثير وتُنتج مقاطع طويلة يمكن التنبؤ بها. لهذا يقدّم AngelSpec نموذجي مسودة بدلًا من حل وسط واحد: يُدرَّب MTP على بيانات حوارية متنوعة، بينما يُعزَّز block-diffusion بأمثلة من الكود والرياضيات.

«يتعامل

AngelSpec مع عدم تجانس الحمل باعتباره قيدًا تصميميًا من الدرجة الأولى»، بحسب تحليل MarkTechPost.

كيف يعمل مسار MTP

يحل مسار MTP مشكلة عدم التطابق بين التدريب والاستدلال عبر مخطط ذي معاملات مشتركة وأعماق متعددة. دُرِّب النموذج الأصلي Hy3 بطبقة MTP واحدة دون فك تكراري (recurrent unrolling)، لذا كانت الرموز في الموضعين الثاني والثالث من المسودة تُقبل بشكل أسوأ بوضوح. يحافظ AngelSpec على D من الأعماق المنطقية، لكنه يعيد استخدام كتلة MTP فيزيائية واحدة، ويفكّها على D خطوات أثناء التدريب. وبحسب مبدأ Training-Time Test المأخوذ من EAGLE-3، لا يحصل العمق k+1 على الرمز المرجعي، بل على تنبؤ argmax من العمق k. إضافة إلى ذلك، يُجمَّد العمود الفقري (backbone) الرئيسي ورأس اللغة، ويجري التدريب على مخرجات النموذج target نفسه.

يتركز التأثير بالضبط حيث تدعو الحاجة إليه. وبحسب بيانات Tencent، ارتفع معدل قبول الموضع الثالث في اختبار GSM8K من 0,290 إلى 0,706، وفي HumanEval — من 0,387 إلى 0,757، بينما لم يتغيّر الموضع الأول تقريبًا (0,799 ← 0,814).

ما الذي يعنيه هذا

يُظهر AngelSpec أن من الأجدى بناء تسريع الاستدلال ليس وفق معيار مرجعي (benchmark) مُتوسَّط، بل وفق عدم التجانس الفعلي للحمل — بنماذج مسودة مختلفة للحوار وللكود. بالنسبة للفرق التي تشغّل نماذج LLM في بيئة الإنتاج، فهذه أداة مفتوحة المصدر لاستخراج مزيد من السرعة من العتاد نفسه دون أي تراجع في الجودة.

أسئلة شائعة

ما هو speculative decoding بعبارات بسيطة?

هي طريقة لتسريع نماذج LLM حيث يخمّن نموذج صغير عدة رموز تالية مسبقًا، ويتحقق منها نموذج كبير في تمريرة واحدة. إذا كان التخمين صحيحًا، يصبح التوليد أسرع؛ ولا تتغير جودة النص في هذه الحالة.

بمَ يختلف AngelSpec عن نموذج مسودة واحد?

يدرّب AngelSpec نموذجين متخصصين: MTP للحوارات ذات الإنتروبيا العالية وblock-parallel للكود والرياضيات ذات المقاطع الطويلة القابلة للتنبؤ. وبحسب قياسات Tencent، رفع هذا متوسط معدل قبول الرموز من 52,8% إلى 66,4%.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…