SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
في يوليو 2026، نشر باحثون على arXiv ورقة أولية (preprint) عن SLPO (Surrogate Latent Policy Optimization) — وهي طريقة تنقل التعلم المعزز بالمكافأة النهائية إلى نماذج الاستدلال الكامن (latent) ذاتية الانحدار، وتُعلّمها أن تختار بنفسها طول "التفكير".
ما هو الاستدلال الكامن
يخزّن الاستدلال الكامن (latent reasoning) الحسابات الوسيطة للنموذج كمتجهات متصلة، بدلاً من فك ترميز كل خطوة إلى رمز نصي (token). ووفقاً لملخص الورقة على arXiv، فإن هذا النهج بات يضاهي، بل يتفوق أحياناً، على سلسلة الاستدلال الصريحة (Chain-of-Thought, CoT) عند آفاق حسابية أقصر بشكل ملحوظ.
الوفر هنا مباشر: يُفكك استدلال CoT التقليدي الفكرة رمزاً تلو الآخر، وكل خطوة وسيطة تكلّف عملية فك ترميز مستقلة. أما النموذج الكامن فيسلك المسار نفسه داخل فضاء التمثيلات الداخلي — بشكل أسرع وأقل تكلفة حسابياً.
لماذا لم يعمل التعلم المعزز مع النماذج الكامنة؟
لم يكن بالإمكان تطبيق التعلم المعزز المعتاد بمكافأة قابلة للتحقق (RLVR) على النماذج الكامنة بسبب عائقين تقنيين. فقد تجاوزت نماذج CoT الصريحة بالفعل حدود تقليد بيانات التدريب بفضل المكافآت المبنية على النتيجة، في حين ظلت النماذج الكامنة حتى الآن "مقيّدة بالتقليد".
والسبب، كما يكتب مؤلفو الورقة، يكمن في طبيعة المسارات الكامنة:
- لا تملك احتمالية محسوبة خطوة بخطوة (per-step likelihood) — أي لا يوجد ما تُربط به المكافأة على مستوى كل خطوة؛
- لا توجد واجهة توقف تكيّفية ضمن ميزانية ثابتة من "التفكير"؛
- ونتيجة لذلك، لم تكن المكافأة النهائية تُفعّل توسيع نطاق الحوسبة وقت الاستدلال (test-time scaling).
ما الذي يقترحه SLPO
يزيل SLPO كلا العائقين عبر مكوّنين. الأول هو كثافة سياسة بديلة (surrogate) تجريبية على الانتقالات الكامنة: توفر توزيعاً احتمالياً يتيح توزيع "الفضل" في النجاح على مستوى المسار بأكمله. والثاني هو "رأس التوقف" (stopping head)، المدرَّب على إشارة الصحة؛ ويؤدي التحسين وفق المكافأة النهائية إلى تحويله إلى سياسة ذات أفق متغيّر تقرر بنفسها متى توقف الاستدلال.
أهم حقائق العمل:
- الطريقة — SLPO (Surrogate Latent Policy Optimization)، ورقة أولية على arXiv، يوليو 2026.
- المهمة — نقل التعلم المعزز بمكافأة النتيجة إلى نماذج الاستدلال الكامن ذاتية الانحدار.
- المكوّن 1 — كثافة سياسة بديلة لتوزيع المكافأة على مستوى المسار.
- المكوّن 2 — رأس توقف مدرَّب على الصحة ← استدلال متغيّر الطول.
- النتيجة — ارتفاع Pass@k عند أخذ العينات المتوازي؛ مزيد من الحوسبة يُخصَّص للأمثلة الصعبة.
ووفقاً للملخص، في وضعي التفكير المستمر و"اللين"، يرفع SLPO مقياس Pass@k عند أخذ العينات المتوازي، ويخصص حسابات كامنة أطول للمهام الصعبة، مع رفع الدقة الحتمية في الوقت نفسه.
"يحسّن SLPO مقياس
Pass@k عند أخذ العينات المتوازي، ويخصص حسابات كامنة أطول للأمثلة الصعبة مع دقة حتمية أعلى" — من ملخص الورقة الأولية على arXiv.
ما الذي يعنيه هذا
يزيل SLPO القيد الرئيسي لنماذج الاستدلال الكامن: إذ أصبح بالإمكان الآن مواصلة تدريبها بمكافأة النتيجة النهائية، تماماً كما يُفعل منذ زمن طويل مع سلسلة الاستدلال النصية. وإذا تأكدت النتيجة على نماذج أكبر، فهذا يمثل طريقاً نحو نماذج استدلال تفكر بتكلفة أقل من CoT التقليدي، وتحدد بنفسها عمق الاستدلال بما يناسب صعوبة المهمة.
أسئلة شائعة
ما هو الاستدلال الكامن بكلمات بسيطة؟
هو أن يُجري النموذج حساباته الوسيطة في فضاء متجهي داخلي، بدلاً من كتابة كل خطوة بالكلمات. ووفقاً لملخص الورقة على arXiv، فإن هذا الأسلوب بات مضاهياً لسلسلة الاستدلال الصريحة (CoT)، مع أنه يتطلب آفاقاً حسابية أقصر.
بمَ يختلف SLPO عن التعلم المعزز المعتاد لـ CoT؟
يعتمد التعلم المعزز المعتاد بمكافأة قابلة للتحقق على الاحتمالية خطوة بخطوة للرموز النصية. أما المسارات الكامنة فلا تملك مثل هذه الاحتمالية، لذلك يُدخل SLPO كثافة سياسة بديلة و"رأس توقف" قابلاً للتدريب — وبهذه الطريقة فقط تبدأ المكافأة النهائية بالعمل مع النماذج الكامنة.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.