arXiv cs.CL→ المصدر

كيف تفهم الشبكات العصبية قيم الدول المختلفة: مجموعة بيانات من 500 ألف مثال

نماذج اللغة منحازة نحو القيم الغربية—وهذه مشكلة منهجية. قدم الباحثون PLURAL: ~500 ألف مثال تفضيل من 20 دولة بناءً على مسح القيم المتكامل (92 دولة). يقلل الضبط الدقيق على مجموعة البيانات خطأ التوافق الثقافي بنسبة 27.7٪. في اختبار عمياء، وجد 176 مشاركاً من الهند والبرازيل واليابان إجابات PLURAL أكثر دقة لثقافتهم.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
كيف تفهم الشبكات العصبية قيم الدول المختلفة: مجموعة بيانات من 500 ألف مثال
المصدر: arXiv cs.CL. كولاج: Hamidun News.
◐ استمع للمقال

تم نشر مجموعة بيانات لتدريب الشبكات العصبية: مجموعة من 500,000 مثال من التفضيلات تغطي قيم 20 دولة، بحيث تعكس نماذج اللغة رؤية العالم ليس فقط للمستخدمين الغربيين.

لماذا نماذج الذكاء الاصطناعي منحازة نحو الغرب؟

معظم نماذج اللغة الحديثة يتم تدريبها بشكل أساسي على النصوص الإنجليزية ومعايرتها وفقاً لتفضيلات المعلقين الأمريكيين والأوروبيين. عندما تتناول هذه النماذج الأدوار العائلية والمواقف تجاه السلطة والدين أو الحقوق الفردية، فإنها تقلل بشكل منهجي من قيمة الأنظمة القيمية للجنوب العالمي وآسيا والشرق الأوسط.

يتم استخدام مساعدات الذكاء الاصطناعي وروبوتات الدردشة والأنظمة التعليمية بشكل متزايد خارج الولايات المتحدة — والانحياز في رؤية العالم يُشعر به المستخدمون مباشرة. في اختبار معمى أجراه مؤلفو PLURAL، لاحظ المشاركون من الهند والبرازيل واليابان أن إجابات LLM القياسية تبدو كشيء أمريكي.

كيف يتم هيكلة مجموعة بيانات PLURAL؟

في قلب PLURAL يقع مسح القيم المتكامل (IVS)، وهو استطلاع اجتماعي تمثيلي من 92 دولة. طور الباحثون خط أنابيب بمرحلتين: يتم تحويل إجابات المستجيبين الحقيقيين إلى سيناريوهات موضوعية، ثم يتلقى كل سيناريو زوجاً من التقييمات — أكثر وأقل توافقاً مع قيم ثقافة معينة.

الحقائق الرئيسية حول مجموعة البيانات:

  • ~500,000 مثال من التفضيلات في النسخة الأولى العامة
  • تغطي 20 دولة من مناطق مختلفة من العالم
  • مبنية على IVS — استطلاع من 92 دولة
  • تقلل متوسط الخطأ المطلق لملف تعريف الثقافة بمقدار 27.7% مقارنة بنماذج الأساس القوية
  • اعترف 176 مشاركاً في الاختبار المعمى من الهند والبرازيل واليابان بأن إجابات PLURAL أكثر دقة لثقافتهم

قام المؤلفون بالتحقق من صحة PLURAL باستخدام ثلاث طرق: التحقق من صحة البيانات (ما إذا تم الحفاظ على الفروق بين الدول من الاستطلاع الأصلي)، والتقييم الآلي لدقة الضبط الدقيق، والاختبار المعمى مع المشاركين الحقيقيين في ثلاث دول.

لماذا هذا مهم لمطوري منتجات الذكاء الاصطناعي

يتم بناء عملية مواءمة نماذج اللغة حالياً في المقام الأول من خلال RLHF مع تفضيلات المعلقين الغربيين. بالنسبة للشركات التي تطلق منتجات الذكاء الاصطناعي في الهند أو البرازيل أو الدول العربية، هذا يعني: قد تقدم النموذج بشكل افتراضي إجابات يُنظر إليها ثقافياً على أنها غريبة أو غير مناسبة.

الحل التقليدي — توظيف معلقين محليين في كل بلد — مكلف وسيء التوسع. يوفر PLURAL مساراً بديلاً: استخدام البيانات من الاستطلاعات الاجتماعية التمثيلية كبديل للتفضيلات الثقافية. تم نشر مجموعة البيانات في الوصول المفتوح على HuggingFace.

ماذا يعني هذا

PLURAL هي أول مورد عام على نطاق واسع يسمح بتدريب نموذج اللغة بشكل مقصود على قيم دولة معينة دون الحاجة إلى فرق تعليق منفصلة. إذا ثبت أن هذا النهج قابل للتكرار، فقد يغير طريقة قيام شركات الذكاء الاصطناعي بتوطين النماذج للأسواق غير الغربية.

الأسئلة الشائعة

إلى أي مدى يحسن PLURAL المواءمة الثقافية؟

يقلل الضبط الدقيق على PLURAL متوسط الخطأ المطلق (MAE) لملف تعريف ثقافة النموذج بمقدار 27.7% مقارنة بنماذج الأساس القوية — هذا هو نتيجة التقييم الآلي الموصوف في ورقة البحث.

أي دول شاركت في الاختبار المعمى؟

أجريت الاختبارات العمياء في ثلاث دول: الهند والبرازيل واليابان. شمل 176 مقيماً قارنوا إجابات PLURAL مع إجابات LLM القياسية لتوافقها مع قيم ثقافة بلادهم.

لماذا نماذج اللغة منحازة نحو الغرب؟

معظم نماذج اللغة الحديثة يتم تدريبها بشكل أساسي على النصوص الإنجليزية ومعايرتها وفقاً لتفضيلات المعلقين الأمريكيين والأوروبيين.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…