arXiv cs.AI→ المصدر

Бенчмарк Learn2Discern: LLM почти не отличают надёжные источники от популярных

Исследователи представили бенчмарк Learn2Discern и проверили на нём 13 языковых моделей — почти 670 000 тестов. Итог: модели отличают надёжные источники от ненадёжных на уровне случайного угадывания и опираются на популярность источника вдвое чаще, чем на его достоверность. Опрос 299 пользователей подтвердил: такие сбои подрывают доверие к ИИ.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
Бенчмарк Learn2Discern: LLM почти не отличают надёжные источники от популярных
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، نشر باحثون على arXiv دراسة حول "تمييز المعلومات" (information discernment) في النماذج اللغوية الكبيرة، وقدّموا معيار Learn2Discern (L2D). وعلى 13 نموذجًا وما يقرب من 670,000 اختبار، تبيّن أن النماذج تميّز بين المصادر الموثوقة وغير الموثوقة بمستوى قريب من التخمين العشوائي تقريبًا.

ما الذي يختبره Learn2Discern

يقيّم Learn2Discern مهارتين للنموذج عند التعامل مع بيانات خارجية: source discernment — مدى ثقة النموذج بشكل أقوى بمصدر موثوق، وtruth discernment — مدى تحديثه لإجابته بقوة أكبر عندما يقرّبه ادعاء جديد من الحقيقة. يقوم الإطار على ثلاث بديهيات معيارية (normative axioms) مع مقاييس قابلة للتفسير. ووفقًا للباحثين، يشارك المستخدمون الحقيقيون هذه المبادئ: أظهر استطلاع مسجَّل مسبقًا (pre-registered) بعينة حصصية (n=299) أن انتهاكها يقلّل الثقة بالنموذج والاستعداد لاستخدامه.

أبرز النتائج

على كلا البُعدين تفشل النماذج: سواء في موثوقية المصدر أو في القرب من الحقيقة، تبقى النتائج عند مستوى عشوائي.

  • 13 نموذجًا، وما يقرب من 670,000 اختبار (trials)
  • تعتمد النماذج على شعبية المصدر بقوة تُقارب ضعف اعتمادها على موثوقيته
  • تُحدَّث الإجابة بدرجة متقاربة تقريبًا، بغضّ النظر عمّا إذا كان الادعاء يقرّب من الحقيقة أو يُبعد عنها
  • تدمج النماذج المعرفة الخارجية بأفضل شكل في الحالات التي تكون فيها توقعاتها المسبقة (priors) أصلًا الأكثر دقة
  • استطلاع المستخدمين: n=299، عينة حصصية، مسجَّل مسبقًا
جاء في ملخص الدراسة على arXiv: "تعمل النماذج بمستوى قريب من التخمين

العشوائي سواء من حيث موثوقية المصدر أو القرب من الحقيقة".

لماذا لا تحلّ النماذج الأحدث المشكلة

تُحسّن النماذج الأكبر والأحدث فقط truth discernment، دون source discernment. وهذه نقطة عمياء لا يعالجها ازدياد تعقيد النموذج: فالقدرة على التمييز بين مصدر موثوق ومصدر شائع لا تنمو مع الحجم. والأسوأ من ذلك، وفقًا لـ Learn2Discern، أن النماذج تدمج المعرفة الخارجية بأكبر فعالية تحديدًا حيث تكون توقعاتها المسبقة أصلًا الأكثر دقة — أي أنها تساعد نفسها حيث تكون الحاجة إلى المساعدة أقل ما يمكن. مع ذلك، وجد الباحثون خبرًا جيدًا: التدخلات البسيطة في وقت الاستدلال (inference-time) تُحسّن كلتا المهارتين في آنٍ واحد، دون الحاجة إلى إعادة تدريب النموذج.

ما الذي يعنيه هذا

مع استبدال النماذج اللغوية الكبيرة (LLM) للبحث التقليدي، تصبح القدرة على التمييز بين مصدر موثوق ومصدر شائع فقط خاصية حرجة من خصائص المواءمة (alignment). وحتى الآن، وبناءً على النماذج الـ13 التي تم اختبارها، لم يتم تعلّم هذه المهارة بعد — وحجم النموذج لا يحلّ المشكلة. وقد أتاح الباحثون مجموعة البيانات (dataset) والاستطلاع في وصول مفتوح كساحة اختبار لهذه المهمة.

الأسئلة الشائعة

ما هو Learn2Discern؟

Learn2Discern (L2D) هو إطار تجريبي ومعيار (benchmark) لتقييم كيفية موازنة النماذج اللغوية الكبيرة للمعلومات الخارجية: هل تثق بالمصادر الموثوقة وهل تقترب من الحقيقة. يقوم على ثلاث بديهيات معيارية مع مقاييس قابلة للتفسير؛ وقد أتاح الباحثون مجموعة البيانات والاستطلاع لإعادة الاستخدام.

ما هي النماذج التي تم اختبارها؟

شملت الدراسة 13 نموذجًا على ما يقرب من 670,000 اختبار. أظهرت جميعها تمييزًا للمصدر والحقيقة قريبًا من المستوى العشوائي، بينما حسّنت النماذج الأحدث والأكبر فقط truth discernment، دون source discernment.

لماذا هذا مهم للبحث القائم على الذكاء الاصطناعي؟

عندما تحلّ النماذج اللغوية الكبيرة محل محركات البحث، فإنها تقرر بنفسها في أي مصدر تثق. وإذا كان النموذج يعتمد على شعبية المصدر بقوة تُقارب ضعف اعتماده على موثوقيته، فإنه يخاطر بترويج ادعاءات منتشرة على نطاق واسع لكنها غير صحيحة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…