السلامة

معيار الاختبار (Benchmark)

معيار الاختبار هو مجموعة اختبارات موحدة تُستخدم لقياس ومقارنة أداء نموذج الذكاء الاصطناعي في المهام المحددة. توفر درجات المعايير مقياساً مشتركاً لتتبع التقدم عبر النماذج والتواصل حول مطالبات القدرة مع الباحثين والعملاء والمنظمين.

في الذكاء الاصطناعي معيار الاختبار هو مجموعة بيانات منتقاة من المدخلات المقترنة بالمخرجات المتوقعة أو معايير التقييم تُدار في ظروف متسقة على نماذج مختلفة. تمتد المعايير على مجموعة واسعة من المهام: فهم القراءة (SQuAD) والاستدلال السليم (HellaSwag) وترميز الأكواد (HumanEval) والرياضيات (MATH) والمعرفة الواسعة (MMLU - الفهم اللغوي متعدد المهام الهائل) والتحقيقات الخاصة بالأمان. عادة ما تكون نتيجة المعيار رقماً واحداً - دقة النسبة المئوية أو معدل النجاح أو ما يشابه - مما يتيح المقارنة المباشرة عبر الأنظمة وعبر الزمن.

يتضمن إدارة المعيار تقديم نفس الفحوصات لكل نموذج في ظروف معادلة (نفس ميزانية الرمز ونفس درجة حرارة العينات ونفس أمثلة القليلة إن وُجدت) ونتائج التسجيل مقابل الحقيقة الأرضية. تختلف طرق التسجيل حسب المهمة: التطابق الدقيق الآلي للمهام الواقعية ومعدلات اجتياز اختبار الوحدة لتوليد الأكواد أو الحكم البشري أو المستند إلى النموذج للمهام مفتوحة النهاية. تجمع المعايير الفوقية مثل HELM (تقييم شامل لنماذج اللغة جامعة ستانفورد) و BIG-bench معايير فردية عديدة في ملفات تعريف مركبة مما يقلل من خطر الاستغلال على أي مقياس واحد.

كانت المعايير هي المركبة الأساسية للتواصل عن تقدم الذكاء الاصطناعي وتمكّن المقارنة الموضوعية والقابلة للتكرار للأنظمة المبنية من قبل منظمات مختلفة. كان درجة MMLU لـ GPT-4 حوالي 86٪ في 2023 تمثل تحسناً كبيراً على GPT-3.5 بحوالي 70٪ وحققت خلال سنة واحدة مما يوضح وتيرة التقدم في القدرة خلال هذه الفترة. تشير النقاشات التنظيمية بشكل متزايد إلى أداء المعايير كدليل على قدرة النظام ومستوى المخاطر مما يجعل منهجية المعيار مسألة سياسة وكذلك بحث.

اعتباراً من 2026 المشكلة المعترف بها جيداً هي تشبع المعيار: تسجل النماذج الرائدة درجات قريبة من السقف على الاختبارات المعترف بها مثل MMLU (90٪+) و HumanEval (95٪+) مما يقلل قيمتها التمييزية. استجاب المجال بخلفاء أصعب - MMLU-Pro و GPQA (Graduate-Level Google-Proof Q&A) و LiveCodeBench لمهام الترميز في العالم الحقيقي و ARC-AGI للاستدلال المجرد. التلوث - بيانات التدريب تحتوي دون قصد على أسئلة المعيار - تبقى مشكلة مستمرة مما يدفع الاهتمام بالمعايير الديناميكية والمحفوظة التي تديرها منظمات مثل معهد سلامة الذكاء الاصطناعي الأمريكي.

مثال

تقارن فريق بحثي نموذج اللغة الجديد بـ 7 مليارات معامل مقابل GPT-4o و Llama 3 على معيار MMLU موضحاً درجات الدقة عبر 57 موضوعاً أكاديمياً لتوضيح أداء معرفة عامة تنافسية بجزء صغير من عدد المعاملات.

مصطلحات مرتبطة

← المسرد