Habr AI→ original

Le même benchmark de LLM a donné 28% et 76% — la différence n'est que dans la façon dont les questions sont posées

Un développeur a testé les LLM en langue russe sur des documents d'entreprise — politiques, commandes, factures, approbations. Le modèle devait trouver le bon document parmi les similaires, citer une ligne spécifique et ne pas échouer quand une date changeait. Un même modèle a affiché sur le benchmark de 28% à 76% — le résultat dépendait non du choix du modèle, mais de la manière dont les requêtes lui étaient organisées.

Traité par IA depuis Habr AI ; édité par Hamidun News
Le même benchmark de LLM a donné 28% et 76% — la différence n'est que dans la façon dont les questions sont posées
Source : Habr AI. Collage: Hamidun News.
◐ Écouter l'article

Un développeur ayant testé des modèles de langage russes sur des documents d'entreprise a obtenu des résultats allant de 28% à 76% sur le même benchmark pour le même modèle — la différence s'explique uniquement par la façon dont les questions sont formulées.

Comment le benchmark est structuré

L'auteur a assemblé un benchmark pour les modèles de langage russes sur des types réels de documents d'entreprise — politiques, ordres, factures et accords. La tâche des modèles était de trouver le document nécessaire parmi d'autres similaires, de citer une ligne spécifique et de ne pas "échouer" quand une seule date dans l'un des documents est modifiée.

  • Plage de résultats pour le même modèle sur un benchmark — de 28% à 76%
  • Type de données — documents d'entreprise : politiques, ordres, factures, accords
  • Compétences testées — trouver le bon document parmi des documents similaires, référence précise à une ligne, résilience aux changements d'un seul détail (date)
  • Raison de la variation — non le modèle lui-même, mais comment les requêtes qui lui sont adressées sont organisées

D'où vient l'écart de 48 points de pourcentage

La découverte clé de l'expérience est que le résultat final s'est avéré hautement dépendant de la façon dont les requêtes au modèle ont été organisées, plutôt que du modèle utilisé. En d'autres termes, le même modèle peut être "échoué" au benchmark ou réussir presque trois fois mieux — simplement en changeant comment la question et le contexte du document lui sont présentés.

Pourquoi cela importe pour les applications LLM en entreprise

Les entreprises construisent de plus en plus des systèmes internes de recherche et de traitement de documents sur les LLMs — ce que l'industrie appelle RAG (génération augmentée par récupération) : les accords, les ordres et les factures sont rarement stockés dans un format pratique pour le modèle, et en pratique le modèle doit sélectionner le document nécessaire parmi plusieurs similaires, puis citer la ligne exacte. C'est exactement ce que le benchmark de l'auteur a testé.

Si la variation des résultats s'explique par le format de la requête plutôt que le choix du modèle, alors pour les équipes implémentant les LLMs dans les processus internes, les investissements dans une organisation appropriée des requêtes et du contexte peuvent produire un effet plus important que de passer à un modèle plus grand ou plus coûteux. Cela est particulièrement notable dans la résilience aux changements "mineurs" : quand une seule date dans l'un des documents est modifiée, et que le modèle continue soit à citer l'ancienne version, soit perd le document nécessaire parmi les similaires — ces défaillances sont généralement ce qui mine la confiance envers les systèmes LLM au sein des entreprises, même si le modèle fonctionne raisonnablement bien en moyenne.

Qu'est-ce que cela signifie

Un benchmark sur des documents d'entreprise réels montre : comparer les modèles "de front" sans fixer la méthode de présentation des questions n'est pas fiable méthodologiquement, et pour l'implémentation pratique des LLMs dans le flux de documents, il est plus important de ne pas chercher un modèle plus puissant, mais de perfectionner comment les questions lui sont posées.

Questions Fréquemment Posées

Qu'est-ce que le benchmark a exactement testé?

Les modèles ont été testés sur la capacité à trouver le bon document parmi des documents similaires les uns aux autres — politiques, ordres, factures et accords — à citer une ligne spécifique et à ne pas perdre en précision si une seule date dans l'un des documents a été modifiée.

Pourquoi le même benchmark a-t-il produit des résultats aussi différents?

Parce que le résultat s'est avéré sensible non pas au modèle lui-même, mais à la façon dont les requêtes qui lui sont adressées ont été organisées — l'auteur de l'expérience lie directement l'écart de 28% à 76% spécifiquement à la façon dont les questions ont été présentées, plutôt qu'à un changement de modèle.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…