تقييم النموذج (Evals)
تقييم النموذج (evals) هو العملية المنهجية لقياس أداء نظام الذكاء الاصطناعي والقدرات ومواضع الفشل باستخدام الاختبارات المنظمة. يوجه التقييم قرارات التطوير وتطلبه المنظمات التنظيمية بشكل متزايد كدليل على الأمان قبل النشر.
يشمل تقييم النموذج النطاق الكامل من الطرق المستخدمة لتقييم ما يمكن وما لا يستطيع نظام الذكاء الاصطناعي فعله. يتضمن هذا مجموعات الاختبارات الآلية التي تقارن مخرجات النموذج مقابل الإجابات المرجعية ودراسات التقييم البشري التي تقيّم الجودة أو عدم الضرر وتمارين الاختبار الحمراء التي تسبر نقاط الضعف والسلوكيات غير المتوقعة. على عكس المقياس الواحد عادة ما تغطي مجموعة تقييم صارمة أبعاداً متعددة - الدقة والقوة والمعايرة والإنصاف والأمان - لأن تحسين بعد واحد غالباً ما يؤدي إلى تدهور آخر.
عادة ما يقدم خط أنابيب تقييم نموذجاً مع مجموعة ثابتة من الفحوصات أو المهام ويسجل ردوده وفقاً لمعايير محددة مسبقاً. بالنسبة لإجابة الأسئلة الواقعية قد يكون التسجيل آلياً (التطابق الدقيق أو التشابه الدلالي مقابل إجابة ذهبية). بالنسبة للتوليد مفتوح النهاية يعطي المقيمون البشريون أو نموذج لغة "حكم" منفصل درجات حول الجودة والامتثال للسياسة. عادة ما تتضمن تقييمات الأمان فحوصات عدائية مصممة لاستخراج مخرجات تنتهك السياسة؛ يقيس المطورون كلاً من معدل الرفض على الطلبات الضارة ومعدل النتيجة الإيجابية الخاطئة على الطلبات الحميدة لتجنب القيود المفرطة. لقد نشرت Anthropic و OpenAI و DeepMind أجزاءً من منهجيات التقييم الخاصة بها لكن العديد من التقييمات الحاصلة على براءات اختراع تبقى داخلية.
يعد التقييم الآلية الأساسية لتحديد ما إذا كان النموذج جاهزاً للنشر وما إذا كانت التحديثات تسبب انحدارات. يُطلب عليها بشكل متزايد من قبل المنظمين: يتطلب قانون الذكاء الاصطناعي في الاتحاد الأوروبي تقييمات المطابقة لأنظمة الذكاء الاصطناعي عالية المخاطر والمعهد الأمريكي لسلامة الذكاء الاصطناعي (تأسس 2023) يجري تقييمات ما قبل النشر لنماذج الحدود المقدمة طواعية من قبل المطورين. بدون تقييمات منظمة لا توجد ادعاءات قابلة للتحقق حول قدرات النموذج أو ملف تعريف المخاطر الخاص به.
بحلول عام 2026 اكتسب نظام التقييم نضجاً ليصبح مجالاً معترفاً به مع أدوات مخصصة (lm-evaluation-harness لـ EleutherAI المستخدمة من قبل لوحة Hugging Face Open LLM) وخدمات تقييم تجارية (Scale AI) ومجموعات بحثية تركز حصراً على منهجية التقييم. أصبحت أساليب LLM-as-judge - حيث يقيّم نموذج قادر مخرجات نموذج آخر - معيار اقتصادي لتوسيع التقييم بما يتجاوز ما يمكن للمقيمين البشريين تغطيته بتكلفة معقولة. نقطة ضعف معترف بها هي "تلوث المعيار" حيث تحتوي بيانات التدريب دون قصد على أسئلة التقييم مما يؤدي إلى نتائج محسّنة ويزيد الطلب على مجموعات التقييم المحفوظة والمحدثة ديناميكياً.