SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
في يوليو 2026، نشر باحثون على arXiv ورقة بعنوان «When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play»، أظهرت أن الضبط الدقيق القياسي (SFT) يرفع دقة نماذج اللغة في الألعاب، لكنه في الوقت نفسه يضيّق بشكل حاد تنوع حركاتها — أكثر مما تتطلبه الموازنة بين الدقة والتنوع.
ما الذي أظهرته الدراسة
بحثت الورقة المنشورة على arXiv (تصنيف cs.CL، المعرّف 2607.19523) في كيفية تأثير supervised fine-tuning على التنوع السلوكي للنماذج في اتخاذ القرارات المتسلسلة. بنى المؤلفون مجموعة محكومة من ألعاب لوحية حتمية مبنية على أشكال من لعبة إكس-أو: فيها تُحسب الحركات المثلى بدقة، ما يعني أن التنوع السلوكي يمكن قياسه مباشرة، دون تقييمات خلافية. جرى التقييم في آن واحد على ثلاثة مستويات — حالات اللعبة الفردية، المباريات الحية في وضع «الحلبة»، ومسارات التدريب نفسها — ما سمح برؤية كيف يتدهور التنوع بالتحديد أثناء عملية الضبط الدقيق، وليس فقط في النموذج النهائي.
- المنصة — arXiv، تصنيف cs.CL، المعرّف 2607.19523، نوع النشر «new»
- بيئة الاختبار — ألعاب لوحية حتمية مبنية على أشكال من لعبة إكس-أو
- الحركات المثلى قابلة للحساب بدقة، لذا يُقاس التنوع مباشرة
- جرى التقييم على ثلاثة مستويات: الحالات الفردية، مباريات «الحلبة»، ومسارات التدريب
- طريقة التخفيف — action augmentation، أي التدريب على جميع الحركات المثلى لكل حالة
لماذا يضيّق SFT خيارات النموذج؟
يتسبب SFT القياسي في انهيار مبكر للتنوع: تنهار سياسة النموذج إلى مجموعة ضيقة من الحركات أسرع مما تبرره المفاضلة بين «الدقة مقابل التنوع». وبحسب الدراسة، غالبًا ما يكبح وضع الاستدلال خطوة بخطوة (reasoning-mode) تنوع الحركات بقوة أكبر، دون أن يحسّن الدقة بشكل منتظم. والملاحظة المهمة هنا: وضع الاستدلال، الذي يُعتقد عادة أنه وسيلة لتحسين القرارات، عمل هنا ضد التنوع — إذ ضيّق مجموعة الحركات دون مكسب ثابت في الدقة.
والسبب، وفق المؤلفين، هو «التقليد ذو الدعم الضيق» (narrow-support imitation): يتعلم النموذج من حركة مثلى واحدة معروضة لكل حالة، ويتجاهل الخيارات الأخرى المتكافئة القيمة. ونتيجة لذلك، لا يفقد البدائل فحسب، بل يفقد أيضًا الميل إلى استكشاف فضاء الحلول.
كيف يمكن التخفيف من ذلك
يحلّ action augmentation المشكلة جزئيًا — أي التدريب دفعة واحدة على جميع الإجراءات المثلى لكل حالة بدلًا من حركة واحدة معروضة. وبحسب الملخص، تحافظ هذه التقنية على «دعم الإجراءات» (action support) وتُبقي على السلوك الاستكشافي للنموذج دون الإضرار بالدقة. مع ذلك، لا يزيل هذا الأسلوب المشكلة بالكامل — إذ يصف المؤلفون التخفيف صراحة بأنه جزئي، لكنهم يُظهرون أن مجرد صياغة التدريب على دعم واسع للإجراءات يُحسّن بالفعل سلوك النموذج.
«الحفاظ على دعم الإجراءات أثناء SFT مهم للحفاظ على السلوك الاستكشافي»،
كما جاء في ملخص الدراسة المنشورة على arXiv.
ماذا يعني هذا
تشير الورقة إلى تكلفة خفية لأسلوب ضبط دقيق شائع: فمع تحسين النموذج من أجل الدقة، قد يحرمه المطورون دون قصد من المرونة والميل إلى الاستكشاف. وبالنسبة للمهام التي يهم فيها تنوع الحلول — عملاء الألعاب، التخطيط، الإجراءات متعددة الخطوات — يوصي المؤلفون بالحفاظ على action support منذ مرحلة SFT.
أسئلة شائعة
ما هو انهيار التنوع في نماذج اللغة؟
انهيار التنوع هو الحالة التي يبدأ فيها النموذج، بعد الضبط الدقيق، باختيار المجموعة الضيقة نفسها من الإجابات أو الحركات، فيفقد البدائل المتكافئة القيمة. وفي هذه الدراسة، كان يحدث مع SFT القياسي في وقت أبكر مما تتطلبه الموازنة بين الدقة والتنوع.
كيف يساعد action augmentation في الحفاظ على التنوع؟
يدرّب action augmentation النموذج على جميع الحركات المثلى لكل حالة، بدلًا من حركة واحدة معروضة فقط. وبحسب الدراسة، يخفف هذا جزئيًا من انهيار التنوع ويحافظ على السلوك الاستكشافي للنموذج.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.