Sûreté

Marquage d'IA

Le marquage d'IA est une technique d'intégration de signaux imperceptibles dans le contenu généré par l'IA — texte, images, audio ou vidéo — pour permettre l'identification ultérieure de son origine créée par machine. Il prend en charge la vérification de la provenance et l'authenticité du contenu sans dégrader la qualité perçue.

Le marquage d'IA désigne les méthodes qui codent les informations d'identification dans les résultats du modèle de manière que les signaux survivent à la manipulation normale mais restent indétectables à la perception humaine. Pour les images, les signaux sont intégrés dans les distributions de valeurs de pixels ou les composantes de fréquence ; pour le texte, des biais statistiques subtils sont introduits à l'étape de sélection des tokens ; pour l'audio et la vidéo, les modifications ciblent les bandes de fréquence ou les couches de métadonnées.

Dans le marquage de texte, une approche influente—publiée par Kirchenbauer et coll. à l'Université du Maryland en 2023—partitionne le vocabulaire d'un modèle en listes de tokens « verts » et « rouges » à chaque étape de génération, biaisant le modèle pour préférer les tokens verts. Un détecteur ayant connaissance de la partition peut alors identifier le texte généré avec une confiance statistique élevée. Le marquage d'image utilise des techniques telles que l'encodage stéganographique ou les perturbations apprises appliquées après la génération. La robustesse aux transformations courantes comme le recadrage, la compression JPEG et la paraphrase reste un défi de recherche actif, et la dynamique antagoniste entre l'insertion et la suppression de marques continue d'évoluer.

Le marquage est considéré comme un outil technique clé pour la provenance du contenu d'IA et l'atténuation de la désinformation. En juillet 2023, les principaux laboratoires d'IA incluant OpenAI, Google, Meta et Anthropic se sont engagés volontairement à développer des systèmes de marquage dans le cadre d'accords de la Maison Blanche. La Loi sur l'IA de l'UE et la législation proposée aux États-Unis font référence au marquage comme mécanisme de transparence pour les contenus synthétiques, augmentant l'incitation réglementaire à l'adoption.

À partir de 2026, aucune norme unique n'a atteint une adoption universelle. L'outil SynthID de Google marque les images d'Imagen et le texte des modèles Gemini, progressivement déployé dans les produits Google. La C2PA (Coalition for Content Provenance and Authenticity), soutenue par Adobe, Microsoft et les fabricants d'appareils photo, fournit une norme de provenance cryptographique complémentaire au niveau du fichier. Des implémentations de marquage en open-source existent mais peuvent être partiellement défaites par des attaques de paraphrase, et la précision de détection se dégrade lorsque le contenu marqué est fortement édité.

Exemple

Une organisation de presse utilise le détecteur SynthID de Google pour vérifier si une image soumise par un pigiste a été générée par un modèle d'image d'IA, la signalant pour examen éditorial avant la publication.

Termes liés

← Glossaire