arXiv cs.LG→ المصدر

Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий

Исследователи представили Prefix-GRPO — метод обучения с подкреплением для малых языковых моделей-агентов. Вместо того чтобы копировать поведение сильной модели-учителя одним махом, он разбивает её траектории на префиксы, воспроизводит их в среде для восстановления промежуточного состояния и дообучает модель онлайн с наградой за задачу. На трёх средах — TextCraft, BabyAI и ALFWorld — подход обошёл и классическую дистилляцию, и стандартный RL.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий
المصدر: arXiv cs.LG. كولاج: Hamidun News.
◐ استمع للمقال

اقترح باحثون Prefix-GRPO، وهي طريقة للتعلم المعزز نُشرت على arXiv (cs.LG) في يوليو 2026. تساعد هذه الطريقة نماذج اللغة الصغيرة العاملة كوكلاء (agents) على التعلم من مسارات نموذج معلم قوي دون تحويلها إلى مجرد تقليد لمرة واحدة، وفي ثلاث بيئات — TextCraft وBabyAI وALFWorld — تتفوق على كل من التقطير الكلاسيكي (distillation) والتعلم المعزز القياسي (RL).

لماذا يتعثر التقطير في المهام الطويلة

يُختزل التقطير المباشر السلوك الغني متعدد الخطوات للمعلم إلى أهداف بخطوة واحدة للتقليد — وهذا غير فعّال في الحالات التي تحدد فيها القرارات المبكرة الحالات والمكافآت المستقبلية. النماذج الصغيرة جذابة كأساس للوكلاء التفاعليين: فهي رخيصة وسريعة. لكن عندما يتعين على الوكيل اجتياز سلسلة طويلة من الإجراءات (التقاط عنصر، الوصول إلى هدف، تنفيذ تعليمة)، فإن التدريب من نوع "كرّر إجابة المعلم" يفقد البنية السببية: يحفظ النموذج الردود النهائية لكنه لا يفهم كيف وصل المعلم إلى الحالة المطلوبة.

كيف تعمل Prefix-GRPO

تقسّم Prefix-GRPO كل مسار من مسارات المعلم إلى مكوّنين: replay-aligned prefix queries (بادئات لإعادة التشغيل) وonline continuations (استكمالات عبر الإنترنت). تتم إعادة تشغيل كل بادئة من جديد في البيئة لاستعادة حالة وسيطة صالحة، وبعدها يواصل الطالب التفاعل بنفسه ويحصل على المكافأة الخاصة بالمهمة.

يكمن الفارق الأساسي عن response-only GRPO في أن الطريقة تطبّق تحديثات سياسة مقتصّة (clipped) أيضًا على الرموز (tokens) التاريخية للمساعد داخل البادئة المعاد تشغيلها. ويقوم بتقدير احتمالات log القديمة لهذه الرموز نقطة تفتيش (checkpoint) منفصلة من نوع SFT، تم الحصول عليها عبر تقطير السياسة. وبفضل ذلك، يندمج تدريب البادئة وتدريب الاستكمال في شكل واحد لتحسين السياسة.

*الطريقة: Prefix-GRPO، تعلّم معزز مبني فوق GRPO

*الفكرة: مسار المعلم = بادئة لإعادة التشغيل + استكمال عبر الإنترنت

*الفارق: تحديثات clipped تُطبَّق أيضًا على رموز المساعد داخل البادئة

*تقدير احتمالات log القديمة — عبر نقطة تفتيش SFT من نوع policy-distilled

*بيئات الاختبار: TextCraft وBabyAI وALFWorld (3 معايير قياسية)

ماذا أظهرت التجارب

في البيئات الثلاث جميعها، حسّنت Prefix-GRPO أداء الوكلاء على النماذج الصغيرة مقارنة بكل من التقطير وخطوط الأساس القياسية للتعلم المعزز. تحققت سلسلة منفصلة من تجارب الاستئصال (ablation) مما يحقق هذا التحسن بالضبط: تبيّن أن مجرد إعادة تشغيل البادئات وحدها غير كافٍ دون تحسين صريح للرموز داخلها.

مجرد إعادة تشغيل البادئات غير كافٍ دون تحسين صريح للرموز داخل البادئة.

— صياغة مأخوذة من ملخص الدراسة على arXiv. بعبارة أخرى، لا تكفي استعادة الحالة الوسيطة للبيئة وحدها — بل يلزم أيضًا تحديث السياسة على الرموز التاريخية، وإلا فلن تحقق الطريقة تأثيرها الكامل. ووفقًا للمؤلفين، أُتيح التنفيذ والنصوص البرمجية اللازمة لإعادة إنتاج النتائج للوصول المفتوح على GitHub.

ماذا يعني هذا

تُعد Prefix-GRPO محاولة لنقل جزء من "ذكاء" نماذج المعلم الكبيرة إلى نماذج مدمجة دون فقدان منطق السلوك متعدد الخطوات. وإذا نجح هذا النهج في التوسع إلى ما هو أبعد من بيئات الألعاب، ستتمكن الوكلاء المحلية الرخيصة من حل المهام الطويلة بشكل أفضل بكثير مما هو عليه الحال مع التقطير التقليدي.

الأسئلة الشائعة

ما هي Prefix-GRPO؟

هي إطار عمل للتعلم المعزز مخصص لنماذج اللغة الصغيرة العاملة كوكلاء. تقسّم مسارات نموذج المعلم إلى بادئات، وتعيد تشغيلها في البيئة لاستعادة الحالة الوسيطة، ثم تواصل تدريب الطالب في تفاعل عبر الإنترنت مع مكافأة مرتبطة بالمهمة.

بم تختلف Prefix-GRPO عن GRPO العادية؟

على عكس response-only GRPO التي تحدّث السياسة فقط بناءً على الردود الجديدة، تطبّق Prefix-GRPO تحديثات مقتصّة أيضًا على الرموز التاريخية للمساعد داخل البادئة المعاد تشغيلها، وتقدّر احتمالات log القديمة الخاصة بها عبر نقطة تفتيش SFT منفصلة من نوع policy-distilled.

أين تم اختبار الطريقة؟

اختبر المؤلفون Prefix-GRPO في ثلاث بيئات للوكلاء — TextCraft وBabyAI وALFWorld — حيث تفوقت فيها على التقطير وعلى خطوط الأساس القياسية للتعلم المعزز. الكود والنصوص البرمجية اللازمة لإعادة الإنتاج متاحة على GitHub.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…