Sûreté

Sécurité de l'IA

La sécurité de l'IA est le domaine interdisciplinaire visant à assurer que les systèmes d'intelligence artificielle fonctionnent de manière fiable, prévisible et sans causer de préjudice involontaire, couvrant la recherche technique, la politique et la gouvernance.

La sécurité de l'IA est le domaine large préoccupé par l'identification, la mesure et l'atténuation des risques découlant des systèmes IA. Elle englobe à la fois les problèmes à court terme — tels que la robustesse du modèle, les biais et les abus à des fins de fraude ou de désinformation — et les préoccupations à plus long terme concernant les systèmes IA hautement capables agissant de manière nuisible à l'humanité à grande échelle. Le domaine s'appuie sur l'apprentissage automatique, la science cognitive, la philosophie et la politique publique, et est distinct mais étroitement lié à l'alignement de l'IA.

La recherche technique en sécurité de l'IA comprend l'interprétabilité (comprendre quels calculs les modèles effectuent en interne et pourquoi), la robustesse (assurer que les modèles se comportent correctement sous décalage de distribution et entrées adversariales), l'alignement (assurer que les systèmes poursuivent les objectifs prévus) et les évaluations de capacité — des protocoles structurés de test par équipe rouge qui mettent au jour les capacités dangereuses telles que l'assistance aux cyberattaques ou les conseils de synthèse d'armes biologiques avant le déploiement. Du côté de la gouvernance, le travail de sécurité comprend les fiches de modèles, les audits tiers, les politiques de déploiement et les cadres de coordination internationale.

La sécurité de l'IA a gagné un élan institutionnel après la sortie de grands modèles de langage comme GPT-3 (2020) et ChatGPT (2022), qui ont démontré que l'IA capable pouvait être abusée à des fins de fraude, de désinformation et de génération de contenu nuisible à grande échelle. Les gouvernements des États-Unis, de l'UE et du Royaume-Uni ont commencé à mandater les évaluations de sécurité pour les systèmes IA de pointe entre 2023 et 2025, citant à la fois les risques d'abus à court terme et les scénarios de risque catastrophique à plus long terme.

En 2026, des équipes dédiées à la sécurité de l'IA opèrent dans tous les principaux laboratoires IA. L'Institut UK AI Safety et l'Institut US AI Safety (AISI) conduisent des évaluations tierces des modèles de pointe avant et après le déploiement. Les consortiums de recherche ouverts publient des suites d'évaluation partagées, et les évaluations formelles de sécurité sont requises avant de déployer l'IA haute capacité dans les secteurs d'infrastructure critique y compris la santé, l'énergie et la finance dans de multiples juridictions.

Exemple

Avant de publier une mise à jour majeure du modèle, un laboratoire l'exécute à travers une suite d'évaluation structurée testant les capacités dangereuses — telles que la capacité à fournir une amélioration significative pour la synthèse d'armes chimiques — et publie un rapport de sécurité résumant les conclusions et les atténuations apportées.

Termes liés

Dernières actualités sur le sujet

← Glossaire