Sûreté

Refus

Un refus est la décision délibérée d'un modèle d'IA de décliner une demande d'utilisateur, généralement parce que l'entraînement de sécurité du système a déterminé que la demande pourrait mener à des résultats nuisibles, illégaux ou violant les politiques.

Le refus est le comportement par lequel un modèle de langage décline à accomplir une demande et, dans la plupart des cas, fournit une explication sur la raison pour laquelle il ne peut pas se conformer. Les refus sont un mécanisme primaire par lequel l'alignement de sécurité se manifeste dans le comportement observable du modèle — la sortie visible des politiques internalisées apprises pendant l'entraînement plutôt qu'un filtre externe appliqué après la génération.

Pendant l'entraînement, des techniques telles que l'apprentissage par renforcement à partir de retours humains (RLHF) et l'optimisation directe des préférences (DPO) enseignent au modèle quelles catégories de demandes refuser. Lorsqu'un utilisateur soumet une requête, le modèle l'évalue par rapport aux politiques internalisées et soit se conforme, soit refuse, soit se conforme avec des modifications. Cette décision n'est pas une recherche codée en dur, mais un comportement émergent appris encodé dans les poids du modèle. Les refus peuvent être déclenchés par le contenu explicite de la demande, l'intention implicite déduite du contexte conversationnel, ou des motifs de surface qui ressemblent à des types de demandes nuisibles connus même lorsque la demande réelle est bénigne.

Les refus protègent contre les abus, mais sont sujets à des erreurs d'étalonnage dans les deux sens. Le sur-refus — déclinaison de demandes légitimes parce qu'elles ressemblent superficiellement à des demandes nuisibles — érode la confiance des utilisateurs et limite l'utilité pratique. Le sous-refus — permettre des demandes réellement nuisibles — crée des défaillances de sécurité. Atteindre un étalonnage correct à travers des populations d'utilisateurs diverses, des langues et des contextes de déploiement est un défi central de l'alignement de l'IA, et un mauvais étalonnage dans l'une ou l'autre direction entraîne des coûts réputationnels et commerciaux pour les développeurs.

À partir de 2026, réduire les faux positifs de refus tout en maintenant la protection contre les dommages réels est devenu un différenciateur compétitif parmi les fournisseurs d'IA. Anthropic, OpenAI et Google ont chacun publié de la documentation sur le comportement des modèles et des évaluations suivant les taux de refus par catégorie de demande. Les modèles open-source de Meta et Mistral présentent généralement moins de refus que les systèmes commerciaux de pointe, créant un compromis significatif entre les garanties de sécurité et l'autonomie des utilisateurs que différents contextes de déploiement résolvent différemment.

Exemple

Un professionnel médical demande à un assistant IA des informations cliniques sur les seuils de surdosage de médicaments à des fins de documentation ; un modèle sur-étalonné refuse pour des motifs d'automutilation, tandis qu'un système correctement étalonné reconnaît le contexte professionnel et fournit l'information clinique avec les avertissements appropriés.

Termes liés

Dernières actualités sur le sujet

← Glossaire