Apple ML Research: كيف تتعلم نماذج الانتشار اختيار التوكنات من دون أساليب استدلالية يدوية
وصلت نماذج اللغة بالانتشار (dLLMs) إلى مستوى النماذج الشبيهة بـ GPT من حيث الجودة، لكن تبقى مشكلة أساسية: كيف تختار التوكن الذي يجب كشفه في كل خطوة. وتقترح Apple ML Research استبدال الأساليب اليدوية مثل confidence thresholding بسياسات متعلمة، بحيث يتعلم النموذج الاستراتيجيات المثلى بنفسه من دون ضبط يدوي للمعلمات لكل مهمة.
معالج بواسطة الذكاء الاصطناعي من Apple ML Research؛ بتحرير Hamidun News
بحث Apple ML: كيف تتعلم نماذج الانتشار اختيار الرموز بدون استدلالات يدوية
نشرت Apple ML Research في يوليو 2026 دراسة حول تدريب سياسات الكشف عن الرموز لنماذج اللغة بالانتشار: بدلاً من الاستدلالات اليدوية التي تتطلب ضبطاً وتظهر نتائج غير مستقرة، يُقترح تدريب عملية اختيار الرموز نفسها.
ما هي نماذج اللغة بالانتشار؟
تختلف نماذج اللغة بالانتشار (dLLMs) بشكل أساسي عن البنى التراجعية المألوفة مثل GPT أو Claude. يبني النموذج التراجعي النص بشكل متسلسل — رمز تلو الآخر من اليسار إلى اليمين. يعمل نموذج الانتشار بشكل مختلف: يبدأ بنص "مقنع" بالكامل ويكشف عن المواضع تدريجياً عبر عدة تكرارات. وفقاً لبحث Apple ML، فإن نماذج dLLMs الحديثة على العديد من المهام العملية تضاهي بالفعل جودة النماذج التراجعية — مع وعد بمزايا في سرعة الاستدلال. نظراً لأن النموذج يمكنه الكشف عن عدة رموز في خطوة واحدة، من الناحية النظرية يمكن تحقيق إنتاجية أعلى بتكاليف حسابية أقل.
لماذا اختيار الرموز يقرر كل شيء
في كل خطوة من خطوات الانتشار، يجب على النموذج الإجابة على السؤال: أي من الرموز المقنعة المتبقية يجب الكشف عنها بعد ذلك؟ هذا السؤال البسيط ظاهرياً يؤثر بشكل مباشر على جودة النص المُنتج وسرعة التشغيل. يثبت النهج الساذج — الاختيار العشوائي للرموز — أنه أسوأ إستراتيجية. وجد الباحثون في Apple أن الاستدلال confidence thresholding يعطي نتائج أفضل بكثير: يعطي النموذج الأولوية لفتح المواضع حيث تكون ثقته (درجة الاحتمالية) أعلى.
حقائق أساسية حول الاستدلالات الحالية:
- يحسّن confidence thresholding جودة العينة مقارنة بالكشف العشوائي
- تزيد الإستراتيجية من إنتاجية الرموز — عدد الرموز لكل وحدة زمن
- العيب هو الحاجة إلى ضبط يدوي للمعاملات لكل مهمة
- أداء الاستدلال غير مستقرة وتختلف حسب التطبيق
ما تقترحه Apple بدلاً من القواعد اليدوية
الفكرة الأساسية للعمل هي استبدال الاستدلالات الثابتة بـ سياسة كشف قابلة للتعلم. بدلاً من أن يختار المطور يدوياً قيم الحد الأدنى ويضبط المعاملات لكل سيناريو، يتعلم النموذج نفسه إستراتيجية اختيار الرموز المثلى.
"لهذه الاستدلالات عيوب: تتطلب ضبطاً يدوياً، وأدائها..." — من ملاحظة دراسة
Apple ML Research.
المبدأ ليس جديداً في التعلم الآلي: استبدال الاستدلالات البشرية بإستراتيجيات محسنة تلقائياً هو المسار القياسي من "الضبط اليدوي" إلى "التعلم من البيانات". عند تطبيقه على نماذج الانتشار، يكتشف هذا النهج إستراتيجيات كشف الرموز التي لم يكن المطور البشري سيفكر فيها مسبقاً، ولا يتطلب معايرة جديدة عند الانتقال إلى مهام جديدة.
ما معنى هذا
تجذب نماذج اللغة بالانتشار الانتباه كأحد الأساليب البديلة الواعدة لبنية نماذج اللغة الكبيرة — خاصة من منظور كفاءة الاستدلال. إذا كان يمكن تدريب سياسات الكشف عن الرموز تلقائياً وتتفوق باستمرار على الاستدلالات اليدوية، فسيؤدي ذلك إلى القضاء على الحاجز العملي الرئيسي لتطبيق dLLMs في الظروف الصناعية، حيث تكون تكلفة السرعة والإنتاج حاسمة.
أسئلة شائعة
كيف تختلف نماذج اللغة بالانتشار عن GPT؟
تنتج النماذج التراجعية مثل GPT النص بشكل متسلسل — رمز واحد في المرة. تبدأ نماذج اللغة بالانتشار بنص "مقنع" بالكامل وتكشف عنه بشكل متكرر عبر عدة خطوات، مما يسمح بمعالجة متوازية لعدة مواضع وقد تسرع الاستدلال.
ما هو Confidence Thresholding في سياق dLLMs؟
هذا استدلال حيث في كل خطوة انتشار، يفتح النموذج أولاً الموضع حيث تكون ثقته أعلى. يُظهر بحث Apple ML أن هذا يحسّن جودة النص وسرعة الإنتاج مقارنة بالكشف العشوائي — لكنه يتطلب ضبطاً يدوياً للمعاملات.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.