Evidence Chain Evaluation: как ИИ-фактчекеру разрешили отвечать «не уверен» вместо ложных вердиктов
Новый фреймворк Evidence Chain Evaluation (ECE) учит ИИ-фактчекер отказываться от вердикта, когда доказательств мало или они противоречат друг другу. Вместо принудительного «правда/ложь» система выдаёт «не уверен». На бенчмарке ECE-Bench это дало 97,8% точности на отвеченных заявлениях при 93,7% покрытия — модель отложила лишь 6 из 95 случаев, почти все с самыми ненадёжными источниками.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи 23 июля 2026 года опубликовали на arXiv фреймворк Evidence Chain Evaluation (ECE) — систему проверки фактов, которая может ответить «не уверен» вместо принудительного «правда/ложь» и держит 97,8% точности на заявлениях, по которым всё же выносит вердикт.
Что такое Evidence Chain Evaluation
Evidence Chain Evaluation — это фреймворк селективного фактчекинга: он разрешает ИИ-агенту воздержаться от решения, когда доказательства слабые, разрозненные или противоречат друг другу. Проверяемая система — агент с инструментами, который собирает доказательства через веб-поиск, научный поиск и исполняемые проверки, а затем возвращает структурированный вердикт с оценкой уверенности и метаданными об источниках.
- Точность на отвеченных заявлениях (selective accuracy) — 97,8% на бенчмарке ECE-Bench
- Стандартная точность — 91,6%, покрытие — 93,7%
- Система отложила 6 из 95 заявлений вместо угадывания
- 5 из 6 отложенных случаев пришлись на источники низшей надёжности (уровень L4)
- Инструменты агента — веб-поиск, научный поиск, исполняемые проверки; код открыт на GitHub
Почему право промолчать важно
Большие языковые модели способны показывать высокую точность фактчекинга, но принудительный бинарный выбор скрывает проблему надёжности: система выдаёт уверенный вердикт даже там, где доказательств почти нет или они противоречивы. ECE решает это через вердикт «uncertain» — отказ, который срабатывает именно в зонах слабых доказательств, а не размазывается по всем заявлениям.
Концентрация отказов в ненадёжных зонах — ключевой аргумент авторов. По данным статьи, 5 из 6 отложенных случаев пришлись на источники самого низкого уровня надёжности (L4). Это подтверждает, что воздержание работает как предохранитель, а не как способ уклониться от сложных вопросов.
«Воздержание работает как ориентированный на безопасность механизм
обработки эпистемически слабых доказательств», — говорится в статье на arXiv.
Где ECE уступает базовым методам
ECE не превосходит сильнейший поисковый baseline по агрегированным метрикам калибровки — Expected Calibration Error, Brier score и AURC. Авторы признают это прямо. Преимущество ECE в другом: система даёт чёткий компромисс селективного предсказания — очень высокую точность на отвеченных заявлениях ценой отказа всего от 6 случаев из 95.
Иными словами, ECE жертвует полнотой ради надёжности там, где это критично. Для фактчекинга, где ложный уверенный вердикт опаснее честного «не знаю», такой размен часто оправдан.
Что это значит
Способность ИИ-системы честно признать нехватку доказательств — практический шаг к доверию к автоматическому фактчекингу. ECE показывает, что калиброванный отказ можно встроить в агента и направить именно туда, где источники слабее всего, не обрушивая общую точность.
Частые вопросы
Что такое Evidence Chain Evaluation?
Это фреймворк селективной проверки фактов, где ИИ-агент может вернуть вердикт «не уверен» вместо принудительного «правда/ложь». Система собирает доказательства веб-поиском, научным поиском и исполняемыми проверками и прикладывает к вердикту оценку уверенности и метаданные об источниках.
Насколько точен ECE?
На бенчмарке ECE-Bench система показала 97,8% точности на отвеченных заявлениях, 91,6% стандартной точности и 93,7% покрытия, отложив 6 из 95 заявлений.
Где взять код ECE?
Код фреймворка открыт: авторы опубликовали его в репозитории cheshireyang/ECE на GitHub.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.