Малые языковые модели Qwen игнорируют инструкции, но выглядят точными в тестах
Исследование на arXiv проверило, следуют ли малые модели Qwen инструкциям, которые конфликтуют с их привычным поведением — например, выбрать заведомо неверный ответ. Оказалось: маленькие модели остаются компетентными, но почти всегда игнорируют такую команду, тогда как крупные показывают чёткий разрыв. Вывод авторов: способность решать задачу и способность подчиняться командам — разные вещи, и обычная метрика точности это маскирует.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
في يوليو 2026، نشر باحثون على arXiv دراسة أظهرت أن نماذج اللغة الصغيرة Qwen تظل دقيقة في المهام، لكنها تتجاهل بشكل منهجي التعليمات التي تتعارض مع سلوكها المعتاد — بينما يخفي مقياس الدقة القياسي هذا الخلل تماماً.
ما الذي اختبره الباحثون
يهدف instruction tuning إلى جعل النموذج ينفذ طلبات المستخدم، لكن ليس من الواضح ما إذا كانت النماذج الصغيرة تمتثل عندما يتعارض الأمر مع سلوكها المعتاد. أخذ الباحثون نماذج Qwen من نوع instruction-tuned بأحجام مختلفة وواجهوها بتعليمة "مضادة" في ثلاثة أنواع من المهام.
أُضيفت إلى المهمة القياسية تعليمة متعارضة: اختيار إجابة خاطئة عمداً في اختبار الاختيار من متعدد، أو إعطاء شعور معاكس في تحليل المشاعر، أو إرجاع نتيجة مضاعفة في مسألة رياضية. سمح هذا التصميم عبر المهام بالتحقق مما إذا كانت المقاومة مرتبطة بمهمة محددة أم أنها سمة سلوكية أعم.
- ثلاث مهام: اختيار الإجابة (MCQA)، تصنيف المشاعر، الأسئلة الرياضية
- التعليمة المتعارضة: اختيار الإجابة الخاطئة، إعطاء شعور معاكس، أو مضاعفة الإجابة
- ثلاثة مقاييس: standard accuracy، وnon-standard accuracy، وInstruction-Following Failure Rate (IFFR)
- النماذج: Qwen من نوع instruction-tuned بعدة أحجام
لماذا تُضلّل الدقة
تكمن الحيلة في التصميم في أن جميع الإجابات تُقارَن بالحل الصحيح الأصلي. النموذج الذي تجاهل التعليمة "المضادة" وحلّ المهمة كالمعتاد يبدو ناجحاً وفق المقياس القياسي — رغم أنه لم ينفذ أمر المستخدم. هذا أمر غير بديهي: يمكن لنموذجين بنفس درجة الدقة على معيار قياسي أن يتصرفا بشكل مختلف تماماً عند إعطائهما أمراً يخالف التوقعات. ولهذا السبب بالتحديد فإن التقرير المعتمد على الدقة القياسية وحدها يخفي إخفاقات اتباع التعليمات، ويُدخل الباحثون مقياساً منفصلاً هو IFFR لرصدها.
ما الذي أظهرته النتائج
اختلفت النتائج بحسب حجم النموذج. ظلت نماذج Qwen الصغيرة كفؤة — إذ حلّت المهمة الأصلية — لكنها تجاهلت بشكل روتيني التعليمة غير القياسية. أظهرت النماذج الكبيرة فجوة واضحة بين الوضعين: فقد تحوّلت فعلياً إلى الأمر "المضاد" بتكرار أكبر بشكل ملحوظ.
نمت كل من الدقة القياسية واتباع التعليمات بشكل عام مع زيادة حجم النموذج، لكن، كما يلاحظ الباحثون، لم يكن النمط ثابتاً عبر مختلف المهام ومجموعات البيانات. زيادة الحجم لم تضمن امتثالاً موثوقاً بنفس الدرجة في كل الحالات.
"الكفاءة في المهمة واتباع التعليمات قدرتان مختلفتان، والتقرير المعتمد
على الدقة القياسية وحدها يُخفي إخفاقات اتباع التعليمات"، جاء في ملخص الدراسة على arXiv.
ما الذي يعنيه هذا
بالنسبة لمن ينشرون نماذج صغيرة، فإن الخلاصة عملية: الدرجة العالية في معيار قياسي لا تعني أن النموذج سيفعل بالضبط ما تطلبه منه. زيادة القدرة على حل المهام لا تمنح تلقائياً تحكماً موثوقاً في السلوك، لذا ينبغي قياس الامتثال بشكل منفصل — بمقياس مثل IFFR — بدلاً من استنتاجه من الدقة الإجمالية. وبالنسبة للتطبيقات التي تهم فيها القابلية للتحكم والسلامة، فهذا سبب إضافي لاختبار النموذج بأوامر متعارضة، لا على مهام مرجعية فقط.
الأسئلة الشائعة
ما هو Instruction-Following Failure Rate (IFFR)؟
IFFR هو مقياس اقترحه الباحثون لنسبة الحالات التي لم ينفذ فيها النموذج التعليمة المُعطاة. وعلى عكس الدقة القياسية، فإنه يُظهر تحديداً إخفاقات اتباع الأمر، لا جودة حل المهمة.
لماذا يبدو النموذج دقيقاً لكنه لا يمتثل؟
لأنه في التجربة تُقارَن الإجابات بالحل الصحيح الأصلي. فإذا تجاهل النموذج التعليمة "المضادة" — مثل "اختر الإجابة الخاطئة" — وحلّ المهمة كالمعتاد، فإن المقياس القياسي يحتسب ذلك نجاحاً، رغم أن النموذج خالف أمر المستخدم.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.