Evidence Chain Evaluation: как ИИ-фактчекеру разрешили отвечать «не уверен» вместо ложных вердиктов
Новый фреймворк Evidence Chain Evaluation (ECE) учит ИИ-фактчекер отказываться от вердикта, когда доказательств мало или они противоречат друг другу. Вместо принудительного «правда/ложь» система выдаёт «не уверен». На бенчмарке ECE-Bench это дало 97,8% точности на отвеченных заявлениях при 93,7% покрытия — модель отложила лишь 6 из 95 случаев, почти все с самыми ненадёжными источниками.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Pesquisadores publicaram em 23 de julho de 2026 no arXiv o framework Evidence Chain Evaluation (ECE) — um sistema de verificação de fatos que pode responder "incerto" em vez de um "verdadeiro/falso" forçado e mantém 97,8% de precisão nas alegações sobre as quais ainda emite um veredito.
O que é o Evidence Chain Evaluation
Evidence Chain Evaluation é um framework de fact-checking seletivo: ele permite que um agente de IA se abstenha de decidir quando as evidências são fracas, dispersas ou contraditórias. O sistema avaliado é um agente com ferramentas que reúne evidências por meio de busca na web, busca científica e verificações executáveis, e então retorna um veredito estruturado com uma pontuação de confiança e metadados sobre as fontes.
- Precisão nas alegações respondidas (selective accuracy) — 97,8% no benchmark ECE-Bench
- Precisão padrão — 91,6%, cobertura — 93,7%
- O sistema adiou 6 de 95 alegações em vez de adivinhar
- 5 dos 6 casos adiados corresponderam a fontes da confiabilidade mais baixa (nível L4)
- Ferramentas do agente — busca na web, busca científica, verificações executáveis; o código está aberto no GitHub
Por que o direito de ficar em silêncio importa
Modelos de linguagem grandes conseguem apresentar alta precisão no fact-checking, mas a escolha binária forçada esconde um problema de confiabilidade: o sistema emite um veredito confiante mesmo quando quase não há evidências ou elas são contraditórias. O ECE resolve isso com um veredito "uncertain" — uma recusa que é acionada justamente nas zonas de evidência fraca, em vez de se espalhar por todas as alegações.
A concentração das recusas fora das zonas confiáveis é o argumento-chave dos autores. Segundo o artigo, 5 dos 6 casos adiados corresponderam a fontes do nível de confiabilidade mais baixo (L4). Isso confirma que a abstenção funciona como uma trava de segurança, e não como uma forma de fugir de perguntas difíceis.
"A abstenção funciona como um mecanismo orientado à segurança para
lidar com evidências epistemicamente fracas", afirma o artigo no arXiv.
Onde o ECE fica atrás dos métodos de referência
O ECE não supera o baseline de busca mais forte nas métricas agregadas de calibração — Expected Calibration Error, Brier score e AURC. Os autores admitem isso diretamente. A vantagem do ECE está em outro lugar: o sistema oferece um compromisso claro de predição seletiva — uma precisão muito alta nas alegações respondidas ao custo de adiar apenas 6 casos de 95.
Em outras palavras, o ECE sacrifica a completude em prol da confiabilidade onde isso é crítico. Para o fact-checking, em que um veredito confiante porém falso é mais perigoso do que um honesto "não sei", essa troca costuma ser justificada.
O que isso significa
A capacidade de um sistema de IA de admitir honestamente a falta de evidências é um passo prático rumo à confiança no fact-checking automatizado. O ECE mostra que a recusa calibrada pode ser incorporada a um agente e direcionada exatamente para onde as fontes são mais fracas, sem derrubar a precisão geral.
Perguntas frequentes
O que é o Evidence Chain Evaluation?
É um framework de verificação seletiva de fatos em que um agente de IA pode retornar um veredito "incerto" em vez de um "verdadeiro/falso" forçado. O sistema reúne evidências por busca na web, busca científica e verificações executáveis, e anexa ao veredito uma pontuação de confiança e metadados sobre as fontes.
Quão preciso é o ECE?
No benchmark ECE-Bench, o sistema apresentou 97,8% de precisão nas alegações respondidas, 91,6% de precisão padrão e 93,7% de cobertura, adiando 6 de 95 alegações.
Onde encontrar o código do ECE?
O código do framework está aberto: os autores o publicaram no repositório cheshireyang/ECE no GitHub.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.