Évaluation de modèle (Evals)
L'évaluation de modèle (evals) est le processus systématique de mesure des performances, des capacités et des modes de défaillance d'un système d'IA en utilisant des tests structurés. Les evals guident les décisions de développement et sont de plus en plus exigées par les régulateurs comme preuve de sécurité avant le déploiement.
L'évaluation de modèle englobe l'ensemble complet des méthodes utilisées pour évaluer ce qu'un système d'IA peut et ne peut pas faire. Cela inclut les suites de tests automatisés qui comparent les résultats du modèle par rapport aux réponses de référence, les études de notation humaine qui évaluent la qualité ou l'innocuité, et les exercices de red-teaming qui sondent les comportements nuisibles ou inattendus. Contrairement à une seule métrique, une suite d'eval rigoureuse couvre généralement plusieurs dimensions—exactitude, robustesse, calibrage, équité et sécurité—car l'optimisation d'une dimension dégénère souvent une autre.
Un pipeline d'eval typique présente à un modèle un ensemble fixe de messages ou de tâches et note ses réponses selon des critères prédéfinis. Pour la réponse à des questions factuelles, la notation peut être automatique (correspondance exacte ou similarité sémantique par rapport à une réponse de référence). Pour la génération ouverte, les évaluateurs humains ou un modèle de langage « juge » distinct attribuent des notes sur la qualité et la conformité aux politiques. Les evals de sécurité incluent généralement des messages antagonistes conçus pour extraire des résultats violant les politiques ; les développeurs mesurent à la fois le taux de refus sur les demandes nuisibles et le taux de faux positifs sur les demandes bénignes pour éviter la sur-restriction. Anthropic, OpenAI et DeepMind ont publié des portions de leurs méthodologies d'eval, bien que de nombreux evals propriétaires restent internes.
Les evals sont le mécanisme principal pour déterminer si un modèle est prêt pour le déploiement et si les mises à jour causent des régressions. Ils sont de plus en plus mandatés par les régulateurs : la Loi sur l'IA de l'UE exige des évaluations de conformité pour les systèmes d'IA à haut risque, et l'Institut américain de sécurité de l'IA (établi en 2023) mène des évaluations pré-déploiement des modèles frontière soumis volontairement par les développeurs. Sans evals structurées, les affirmations vérifiables sur les capacités ou le profil de risque d'un modèle ne sont pas possibles.
Par 2026, l'écosystème d'eval s'est maturé en un sous-domaine reconnu, avec des outils dédiés (lm-evaluation-harness d'EleutherAI, utilisé par le Hugging Face Open LLM Leaderboard), des services d'évaluation commerciaux (Scale AI) et des groupes de recherche axés uniquement sur la méthodologie d'évaluation. Les approches LLM-as-judge—où un modèle capable note les résultats d'un autre modèle—sont devenues standard pour mettre à l'échelle l'évaluation au-delà de ce que les évaluateurs humains peuvent couvrir de manière abordable. Une faiblesse reconnue est la « contamination des benchmarks », où les données d'entraînement contiennent inadvertamment des questions d'eval, gonflant les scores mesurés et créant une demande d'ensembles d'eval retenus et rafraîchis dynamiquement.