D2VBench: бенчмарк из 10 000 дилемм проверяет ценностное выравнивание LLM
Команда исследователей выложила на arXiv бенчмарк D2VBench — 10 000 сценариев повседневных дилемм, где сталкиваются несколько ценностей сразу. В основе — 158 вручную размеченных ценностных концепций, а оценка сочетает закрытые и открытые вопросы. Через бенчмарк уже прогнали 8 популярных языковых моделей; датасет открыт на GitHub.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
في يوليو 2026، قدّم باحثون على arXiv معيار D2VBench — أداة لتقييم التوافق القيمي (value alignment) لنماذج اللغة الكبيرة عبر 10000 معضلة يومية، استناداً إلى 158 مفهوماً قيمياً مُصنَّفاً يدوياً.
ما الذي يختبره D2VBench
يقيّم D2VBench القيم الكامنة وراء إجابات النموذج عندما يتصادم عدة مبادئ في آن واحد داخل موقف يومي — على سبيل المثال، الصدق مقابل الرعاية، أو المصلحة الشخصية مقابل الصالح العام. وبحسب الباحثين، فإن مجموعات الاختبار السابقة لم تُغطِّ بشكل كافٍ هذا النوع من التعارضات متعددة العوامل، واعتمدت على صيغ تقييم مبسّطة أكثر من اللازم.
جرى بناء كل سيناريو من السيناريوهات العشرة آلاف (10000) على مراحل — من خلال تعاون بين نماذج اللغة والمُصنِّفين البشريين. ويقوم الأساس على 158 مفهوماً قيمياً دقيقاً (fine-grained)، مُصنَّفة يدوياً، وهو ما يتيح ربط استجابة النموذج بفئة قيمية محددة بدلاً من "الأخلاقية" العامة.
- الحجم: 10000 سيناريو من المعضلات اليومية الواقعية
- أساس التصنيف: 158 مفهوماً قيمياً مُوسَّماً يدوياً
- البناء: تعاون متعدد المراحل بين نماذج اللغة الكبيرة والبشر
- التقييم: مزيج من أسئلة مغلقة (اختيار من متعدد) وأسئلة مفتوحة (open-ended)
- التغطية: تم اختبار 8 نماذج لغوية شائعة
- البيانات: مجموعة البيانات منشورة على GitHub (tjunlp-lab/D2VBench)
كيف يعمل التقييم
بُني التقييم في D2VBench كمزيج: تُجمع الأسئلة المغلقة ذات الخيارات مع أسئلة مفتوحة يصوغ فيها النموذج إجابته بحرية. وهذا الشكل، بحسب تصميم الباحثين، لا يرصد فقط الاختيار "الصحيح"، بل أيضاً كيف يبرر النموذج قراره وكيف يرتّب أولوياته بين القيم المتعارضة.
مرّر الباحثون 8 نماذج لغوية شائعة عبر المعيار. وبحسب بياناتهم، يُظهر D2VBench موثوقية واستقراراً عاليين، ويعكس توافق النماذج عبر فئات وأبعاد قيمية مختلفة — أي أنه يقدّم صورة أكثر تفصيلاً من التقييم الثنائي "أخلاقي أو غير أخلاقي".
"المعايير الحالية لا تُغطي بشكل كافٍ المعضلات القيمية في السيناريوهات
اليومية ذات التعارضات القيمية المتعددة، وتستخدم صيغ تقييم مبسّطة"، بحسب ما جاء في ورقة باحثي D2VBench على arXiv.
لماذا يهم هذا الأمر
يصبح التوافق القيمي أمراً حاسماً مع دخول نماذج اللغة الكبيرة إلى سيناريوهات يومية واقعية — من النصائح الصحية إلى النزاعات العائلية والعملية. ويُصمَّم D2VBench، كما هو مذكور في الوصف على arXiv، ليكون أداة بحثية أكثر واقعية وتفصيلاً في هذا المجال: فهو لا يعرض درجة متوسطة لـ"السلامة"، بل يوضح سلوك النموذج عبر محاور قيمية محددة.
ونشر مجموعة البيانات في وصول مفتوح على GitHub يعني أن فرقاً أخرى ستتمكن من إعادة إنتاج النتائج وتمرير نماذجها الخاصة عبر الـ10000 معضلة، وليس فقط النماذج الثمانية (8) التي اختبرها الباحثون. ويسمح التقسيم على 158 مفهوماً وصيغتَي الأسئلة بمقارنة النماذج ليس برقم واحد فقط، بل بملف سلوكي قيمي كامل.
ما الذي يعنيه هذا
يحوّل D2VBench الحديث عن "سلامة" الذكاء الاصطناعي من مستوى التصريحات العامة إلى شبكة قابلة للقياس مكوّنة من 158 مفهوماً قيمياً. وبالنسبة للمطورين، فهذه وسيلة لرؤية النقطة الدقيقة التي يتعثر عندها النموذج عند تعارض القيم، بدلاً من مجرد الحصول على درجة إجمالية واحدة.
أسئلة شائعة
ما هو D2VBench؟
D2VBench هو معيار لتقييم التوافق القيمي لنماذج اللغة الكبيرة، يتألف من 10000 سيناريو لمعضلات يومية ويستند إلى 158 مفهوماً قيمياً مُصنَّفاً يدوياً.
كم عدد السيناريوهات في D2VBench؟
يحتوي المعيار على 10000 سيناريو من المعضلات اليومية الواقعية، جرى بناء كل واحد منها على عدة مراحل بمشاركة نماذج لغوية ومُصنِّفين بشريين.
أين يمكن تنزيل مجموعة بيانات D2VBench؟
مجموعة البيانات منشورة في وصول مفتوح على GitHub ضمن مستودع tjunlp-lab/D2VBench — ويمكن استخدامها لاختبار نماذج خاصة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.