Benchmark
Un benchmark est un ensemble de tests standardisés utilisés pour mesurer et comparer les performances des modèles d'IA sur des tâches définies. Les scores de benchmark fournissent une échelle commune pour suivre les progrès entre les modèles et communiquer les affirmations de capacité aux chercheurs, aux clients et aux régulateurs.
En IA, un benchmark est un ensemble de données organisé de résultats appariés à des résultats attendus ou à des critères d'évaluation, administré dans des conditions cohérentes à différents modèles. Les benchmarks couvrent une large gamme de tâches : la compréhension de la lecture (SQuAD), le raisonnement du sens commun (HellaSwag), le codage (HumanEval), les mathématiques (MATH), les connaissances générales (MMLU — Massive Multitask Language Understanding) et les sondes spécifiques à la sécurité. Un résultat de benchmark est généralement un nombre unique—pourcentage de précision, taux de passage ou similaire—permettant une comparaison directe entre les systèmes et dans le temps.
L'administration du benchmark implique de présenter les mêmes messages à chaque modèle dans des conditions équivalentes (même budget de tokens, même température d'échantillonnage, les mêmes exemples few-shot si présents) et de noter les réponses par rapport à la vérité de base. Les méthodes de notation varient selon la tâche : correspondance exacte automatique pour les tâches factuelles, taux de passage des tests unitaires pour la génération de code, ou jugement humain ou basé sur le modèle pour les tâches ouvertes. Les méta-benchmarks comme HELM (Holistic Evaluation of Language Models, Stanford) et BIG-bench agrègent de nombreux benchmarks individuels en profils composites, réduisant le risque de jeu sur n'importe quelle métrique unique.
Les benchmarks ont été le véhicule principal pour communiquer les progrès de l'IA et permettent une comparaison objective et reproductible des systèmes construits par différentes organisations. Le score MMLU de GPT-4 d'environ 86% en 2023 représentait une grande amélioration par rapport à GPT-3.5 à environ 70%, réalisée en un an, illustrant le rythme de l'avance des capacités au cours de cette période. Les discussions réglementaires font de plus en plus référence aux performances de benchmark comme preuve de la capacité du système et du niveau de risque, rendant la méthodologie de benchmark une question de politique ainsi que de recherche.
À partir de 2026, un problème bien reconnu est la saturation des benchmarks : les modèles leaders marquent près du plafond sur les tests établis tels que MMLU (90%+) et HumanEval (95%+), réduisant leur valeur discriminante. Le domaine a répondu avec des successeurs plus difficiles—MMLU-Pro, GPQA (Graduate-Level Google-Proof Q&A), LiveCodeBench pour les tâches de codage réelles, et ARC-AGI pour le raisonnement abstrait. La contamination—les données d'entraînement contenant inadvertamment des questions de benchmark—reste une préoccupation persistante, suscitant un intérêt pour les benchmarks dynamiques et retenus maintenus par des organisations telles que l'Institut américain de sécurité de l'IA.