arXiv cs.AI→ المصدر

Evidence Chain Evaluation: как ИИ-фактчекеру разрешили отвечать «не уверен» вместо ложных вердиктов

Новый фреймворк Evidence Chain Evaluation (ECE) учит ИИ-фактчекер отказываться от вердикта, когда доказательств мало или они противоречат друг другу. Вместо принудительного «правда/ложь» система выдаёт «не уверен». На бенчмарке ECE-Bench это дало 97,8% точности на отвеченных заявлениях при 93,7% покрытия — модель отложила лишь 6 из 95 случаев, почти все с самыми ненадёжными источниками.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
Evidence Chain Evaluation: как ИИ-фактчекеру разрешили отвечать «не уверен» вместо ложных вердиктов
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

نشر باحثون في 23 يوليو 2026 على arXiv إطار العمل Evidence Chain Evaluation (ECE) — نظام تحقق من الحقائق يمكنه الإجابة بـ"غير متأكد" بدلاً من إجبار الإجابة بـ"صحيح/خاطئ"، ويحافظ على دقة 97,8% في الادعاءات التي يصدر بشأنها حكمًا فعليًا.

ما هو Evidence Chain Evaluation

Evidence Chain Evaluation هو إطار عمل للتحقق الانتقائي من الحقائق: يسمح لوكيل ذكاء اصطناعي بالامتناع عن اتخاذ قرار عندما تكون الأدلة ضعيفة أو متناثرة أو متناقضة. النظام الخاضع للاختبار هو وكيل مزوّد بأدوات يجمع الأدلة عبر البحث على الويب والبحث العلمي والتحقّقات القابلة للتنفيذ، ثم يعيد حكمًا منظّمًا مع درجة ثقة وبيانات وصفية عن المصادر.

  • الدقة في الادعاءات التي تمت الإجابة عنها (selective accuracy) — 97,8% على معيار ECE-Bench
  • الدقة القياسية — 91,6%، والتغطية — 93,7%
  • أرجأ النظام البت في 6 من أصل 95 ادعاءً بدلاً من التخمين
  • ارتبطت 5 من أصل 6 حالات مؤجَّلة بمصادر ذات أدنى مستوى موثوقية (المستوى L4)
  • أدوات الوكيل — البحث على الويب، البحث العلمي، التحقّقات القابلة للتنفيذ؛ والكود مفتوح المصدر على GitHub

لماذا يهم حق الصمت

يمكن لنماذج اللغة الكبيرة أن تُظهر دقة عالية في التحقق من الحقائق، لكن الاختيار الثنائي الإجباري يخفي مشكلة موثوقية: يصدر النظام حكمًا واثقًا حتى عندما تكون الأدلة شبه معدومة أو متناقضة. يحل ECE هذه المشكلة عبر حكم "uncertain" — رفض يُفعَّل تحديدًا في مناطق الأدلة الضعيفة، بدلاً من أن يتوزع على جميع الادعاءات.

تركّز الرفض خارج المناطق الموثوقة هو الحجة الأساسية للباحثين. وبحسب الورقة البحثية، ارتبطت 5 من أصل 6 حالات مؤجَّلة بمصادر من أدنى مستوى موثوقية (L4). وهذا يؤكد أن الامتناع يعمل كصمام أمان، لا كوسيلة للتهرب من الأسئلة الصعبة.

«يعمل الامتناع كآلية موجّهة نحو السلامة للتعامل مع الأدلة الضعيفة

معرفيًا»، بحسب ما ورد في الورقة البحثية على arXiv.

أين يتراجع ECE عن الأساليب المرجعية

لا يتفوق ECE على أقوى خط أساس بحثي (baseline) في مقاييس المعايرة المجمّعة — Expected Calibration Error وBrier score وAURC. ويعترف الباحثون بذلك صراحةً. تكمن ميزة ECE في مكان آخر: يقدّم النظام مقايضة واضحة في التنبؤ الانتقائي — دقة عالية جدًا في الادعاءات التي تمت الإجابة عنها مقابل إرجاء 6 حالات فقط من أصل 95.

بعبارة أخرى، يضحّي ECE بالشمولية لصالح الموثوقية حيثما كان ذلك حاسمًا. وبالنسبة للتحقق من الحقائق، حيث يكون الحكم الواثق الكاذب أخطر من إجابة صادقة بـ"لا أعرف"، غالبًا ما تكون هذه المقايضة مبرَّرة.

ماذا يعني هذا

قدرة نظام الذكاء الاصطناعي على الاعتراف بصدق بنقص الأدلة خطوة عملية نحو الثقة في التحقق الآلي من الحقائق. يُظهر ECE أنه يمكن دمج الرفض المُعايَر داخل الوكيل وتوجيهه تحديدًا إلى حيث تكون المصادر الأضعف، دون التسبب في انهيار الدقة الإجمالية.

الأسئلة الشائعة

ما هو Evidence Chain Evaluation؟

هو إطار عمل للتحقق الانتقائي من الحقائق يمكن فيه لوكيل ذكاء اصطناعي أن يعيد حكم "غير متأكد" بدلاً من إجبار الإجابة بـ"صحيح/خاطئ". يجمع النظام الأدلة عبر البحث على الويب والبحث العلمي والتحقّقات القابلة للتنفيذ، ويُرفق بالحكم درجة ثقة وبيانات وصفية عن المصادر.

ما مدى دقة ECE؟

على معيار ECE-Bench، أظهر النظام دقة 97,8% في الادعاءات التي تمت الإجابة عنها، ودقة قياسية 91,6%، وتغطية 93,7%، مع إرجاء البت في 6 من أصل 95 ادعاءً.

أين يمكن الحصول على كود ECE؟

كود إطار العمل مفتوح المصدر: نشره الباحثون في مستودع cheshireyang/ECE على GitHub.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…