arXiv cs.AI→ المصدر

S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам

Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

لماذا يكون التعلم المعزز من التغذية الراجعة البشرية (RLHF) غير مستقر

يكون RLHF القياسي غير مستقر لأن النموذج يحصل على مكافأة عددية واحدة فقط عن الرد بأكمله، ثم يتم "توزيع" هذا التقييم لاحقًا على تحديثات السياسة على مستوى الرموز (tokens) الفردية. ونتيجة لذلك، يصعب تحديد أي جزء بالضبط من الرد استحق تقييمًا مرتفعًا أو منخفضًا — وتبقى مهمة توزيع "الفضل" (credit assignment) داخل الرد غامضة.

فنموذج التفضيلات (preference model)، المدرَّب على مقارنات ثنائية بين الردود، يقيّم الرد ككل فقط، وليس كلمة بكلمة. فإشارة التفضيل محددة فقط على مستوى الرد بأكمله (response level)، لذا فإن نقلها الآلي إلى الرموز الفردية يُدخل ضجيجًا إضافيًا ويزعزع استقرار التدريب.

ما الذي يقترحه S2T-RLHF

يُدخل S2T-RLHF (sentence-to-token) مستوى وسيطًا بين الرد بأكمله والرمز الفردي — وهو الجملة. تقوم الطريقة أولًا بتوزيع مكافأة الرد بأكمله على الجُمل، ثم تُجري داخل كل جملة تعديلًا محدودًا (bounded) فقط على مستوى الرموز. والتفصيل المهم هنا: أن ذلك لا يتطلب إعادة تدريب نموذج المكافأة (reward model)، ولا إعداد تصنيف منفصل للمكافآت على مستوى الرموز.

  • ثلاثة مستويات من التفصيل (granularity): الرد بأكمله ← الجملة ← الرمز
  • تُقسَّم المكافأة أولًا على الجُمل، ثم تُضبط بشكل محدود على مستوى الرموز
  • لا يتطلب إعادة تدريب نموذج المكافأة
  • لا يتطلب token-level supervision — أي تصنيفًا منفصلًا للمكافآت على مستوى الرموز
  • تم اختباره على عدة مجموعات بيانات وإعدادات تحسين مختلفة

وبحسب المؤلفين، يجعل هذا النهج التدريب أكثر استقرارًا ومتانة، بينما تظل جودة التوافق مع التفضيلات (preference alignment) قادرة على المنافسة — أي أن الاستقرار لا يُدفَع ثمنه من الدقة.

لماذا الجملة وليس الرمز

اختيرت الجملة كمقياس وسيط لأنها تحافظ على التماسك الدلالي وتكون في الوقت نفسه أكثر مقاومة للضجيج من الرمز الفردي. ويعارض المؤلفون صراحةً الافتراض الشائع القائل بأنه كلما كان تقسيم المكافأة أدق، كان التحسين أفضل.

«عندما تكون إشارات التفضيل مشوبة بالضجيج ومحددة فقط على مستوى الرد،

فإن التنقيح المفرط الدقة للمكافأة قد يضخّم عدم اليقين ويزعزع استقرار التدريب» — بحسب ما جاء في الورقة المنشورة على arXiv.

وبدلًا من السعي وراء أدق مكافأة ممكنة، يصوغ المؤلفون مبدأً واعيًا بالتفصيل (granularity-aware): يجب أن يكون تصميم المكافأة موجهًا نحو الاستقرار، لا نحو أقصى دقة في التوزيع. ويوازن مستوى الجملة بين التماسك الدلالي والمقاومة لضجيج مستوى الرموز.

ماذا يعني هذا

يبقى RLHF الوسيلة الأساسية لضبط النماذج اللغوية الكبيرة وفق التفضيلات البشرية، لكن عدم استقراره يظل صداعًا مستمرًا للمهندسين. يقدّم S2T-RLHF وصفة غير مكلفة: عدم السعي وراء أدق مكافأة ممكنة، بل اختيار مقياس وسيط معقول — هو الجملة. وإذا تكررت هذه النتائج على مهام ونماذج أخرى، فقد يترسخ "مستوى الجملة" كمستوى التفصيل الافتراضي في التدريب على التفضيلات.

الأسئلة الشائعة

ما هو RLHF؟

RLHF (reinforcement learning from human feedback) هو التعلم المعزز اعتمادًا على التغذية الراجعة البشرية. يُعاد ضبط النموذج وفق تفضيلات البشر: إذ ينتج نموذج المكافأة، المدرَّب على مقارنات الردود، مكافأةً تُستخدم لتصحيح سياسة التوليد.

هل يحتاج S2T-RLHF إلى تصنيف إضافي؟

لا. فبحسب وصف الطريقة، يعمل S2T-RLHF دون إعادة تدريب نموذج المكافأة ودون token-level supervision. وهذا يعني أنه لا حاجة إلى تصنيف تدريبي جديد للمكافآت على مستوى الرموز، ولا إلى تدريب منفصل لمقيّم — إذ تعيد الطريقة استخدام إشارة التفضيلات الموجودة أصلًا.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…