arXiv cs.AI→ original

Бенчмарк Learn2Discern: LLM почти не отличают надёжные источники от популярных

Исследователи представили бенчмарк Learn2Discern и проверили на нём 13 языковых моделей — почти 670 000 тестов. Итог: модели отличают надёжные источники от ненадёжных на уровне случайного угадывания и опираются на популярность источника вдвое чаще, чем на его достоверность. Опрос 299 пользователей подтвердил: такие сбои подрывают доверие к ИИ.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Бенчмарк Learn2Discern: LLM почти не отличают надёжные источники от популярных
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv une étude sur le « discernement de l'information » (information discernment) chez les grands modèles de langage et ont présenté le benchmark Learn2Discern (L2D). Sur 13 modèles et près de 670 000 tests, il est apparu que les modèles distinguent les sources fiables des sources non fiables à peu près au niveau du hasard.

Ce que teste Learn2Discern

Learn2Discern évalue deux compétences du modèle lorsqu'il travaille avec des données externes : le source discernment — dans quelle mesure le modèle fait davantage confiance à une source fiable, et le truth discernment — dans quelle mesure il actualise sa réponse plus fortement lorsqu'une nouvelle affirmation le rapproche de la vérité. Le cadre repose sur trois axiomes normatifs assortis de métriques interprétables. Selon les auteurs, les utilisateurs réels partagent ces principes : une enquête pré-enregistrée menée sur un échantillon par quotas (n=299) a montré que leur violation réduit la confiance envers le modèle et la volonté de l'utiliser.

Principaux résultats

Sur les deux dimensions, les modèles échouent : tant pour la fiabilité de la source que pour la proximité avec la vérité, les résultats restent au niveau du hasard.

  • 13 modèles, près de 670 000 tests (trials)
  • Les modèles s'appuient sur la popularité d'une source deux fois plus fortement que sur sa fiabilité
  • La réponse est actualisée de façon quasi identique, que l'affirmation rapproche ou éloigne de la vérité
  • Les modèles intègrent le mieux les connaissances externes précisément là où leurs propres priors sont déjà les plus précis
  • Enquête auprès des utilisateurs : n=299, échantillon par quotas, pré-enregistrée
«

Les modèles se comportent presque comme s'ils devinaient au hasard, aussi bien pour la fiabilité de la source que pour la proximité avec la vérité », indique le résumé de l'étude sur arXiv.

Pourquoi les modèles plus récents ne résolvent pas le problème

Les modèles plus grands et plus récents n'améliorent que le truth discernment, pas le source discernment. C'est un angle mort que l'augmentation de la complexité du modèle ne corrige pas : la capacité à distinguer une source crédible d'une source populaire ne progresse pas avec la taille. Pire encore, selon Learn2Discern, les modèles intègrent les connaissances externes le plus efficacement précisément là où leurs propres priors sont déjà les plus précis — autrement dit, ils s'aident eux-mêmes là où l'aide est le moins nécessaire. Les auteurs ont toutefois trouvé une bonne nouvelle : de simples interventions au moment de l'inférence (inference-time) améliorent les deux compétences à la fois, sans réentraînement du modèle.

Ce que cela signifie

À mesure que les LLM remplacent la recherche traditionnelle, la capacité à distinguer une source crédible d'une source simplement populaire devient une propriété critique d'alignement (alignment). Pour l'instant, à en juger par les 13 modèles testés, cette compétence n'est pas acquise — et la taille du modèle ne résout pas le problème. Les auteurs ont mis le dataset et l'enquête en libre accès comme banc d'essai pour cette tâche.

Questions fréquentes

Qu'est-ce que Learn2Discern ?

Learn2Discern (L2D) est un cadre expérimental et un benchmark permettant d'évaluer comment les LLM pondèrent l'information externe : font-ils confiance aux sources fiables et se rapprochent-ils de la vérité. Il repose sur trois axiomes normatifs assortis de métriques interprétables ; les auteurs ont ouvert le dataset et l'enquête pour réutilisation.

Quels modèles ont été testés ?

L'étude a porté sur 13 modèles pour près de 670 000 tests. Tous ont montré un discernement de la source et de la vérité proche du niveau du hasard, tandis que les modèles plus récents et plus grands n'amélioraient que le truth discernment, pas le source discernment.

Pourquoi est-ce important pour la recherche par IA ?

Lorsque les LLM remplacent les moteurs de recherche, ils décident eux-mêmes en quelle source faire confiance. Si un modèle s'appuie sur la popularité d'une source deux fois plus fortement que sur sa fiabilité, il risque de reproduire des affirmations très répandues mais erronées.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…