IA Constitutionnelle
L'IA Constitutionnelle est une méthode d'entraînement développée par Anthropic dans laquelle un modèle d'IA critique et révise ses propres résultats selon un ensemble écrit de principes, réduisant la dépendance à l'annotation humaine à grande échelle pour filtrer les comportements nuisibles.
L'IA Constitutionnelle (CAI) est une technique d'entraînement à l'alignement et à la sécurité introduite par Anthropic dans un article de décembre 2022. Plutôt que de s'appuyer entièrement sur des évaluateurs humains pour identifier les résultats nuisibles, la CAI intègre une liste de principes — la constitution — directement dans la boucle d'entraînement. Ces principes peuvent inclure des directives telles que l'évitement du contenu qui facilite les activités illégales ou les instructions dérivées de documents comme la Déclaration universelle des droits de l'homme des Nations unies.
L'entraînement procède en deux étapes. À l'étape d'apprentissage supervisé, le modèle génère des réponses à des invites potentiellement nuisibles, puis utilise les principes constitutionnels pour critiquer chaque réponse et produire une version révisée. Ces résultats auto-révisés deviennent un nouvel ensemble de données de fine-tuning. À la deuxième étape, l'apprentissage par renforcement à partir du retour d'IA (RLAIF) remplace une grande partie de l'apprentissage par renforcement traditionnel à partir du retour humain (RLHF) : un modèle distinct évalue les réponses candidates par rapport à la même constitution et attribue des scores de préférence, générant un signal d'entraînement sans nécessiter qu'un évaluateur humain évalue chaque comparaison.
L'approche compte pour deux raisons. Premièrement, elle réduit le coût et le goulot d'étranglement de mise à l'échelle de l'annotation humaine pour la sécurité : générer des millions de comparaisons de préférences avec des évaluateurs humains est coûteux et lent, tandis qu'un critique basé sur l'IA peut fonctionner avec un débit beaucoup plus élevé. Deuxièmement, elle rend les normes normatives guidant le modèle explicites et auditables — n'importe qui peut lire la constitution et raisonner sur les comportements que le système est entraîné à promouvoir ou éviter, ce qui est plus difficile avec les pipelines RLHF opaques.
À partir de 2026, l'IA Constitutionnelle soutient la famille de modèles Claude d'Anthropic. La recherche ultérieure a exploré comment rendre les constitutions configurables par l'opérateur, permettant aux entreprises de définir des principes personnalisés pour leurs déploiements, et la combinaison de la CAI avec des sondes d'interprétabilité et des protocoles de débat pour capturer les comportements que l'auto-critique seule pourrait manquer.