3DNews AI→ original

Institut Alan Turing a contourné les protections de sécurité de l'IA en déguisant les requêtes en tâches de codage

Des chercheurs de l'Institut Alan Turing ont découvert un nouveau moyen de contourner les protections de sécurité des modèles d'IA. Si un modèle refuse de répondre directement à une demande inappropriée, elle peut être intégrée dans une liste de tâches pour un agent d'IA aidant à écrire du code logiciel — et les mécanismes de sécurité ne se déclenchent pas toujours. La vulnérabilité a été décrite dans un article de recherche publié.

Traité par IA depuis 3DNews AI ; édité par Hamidun News
Institut Alan Turing a contourné les protections de sécurité de l'IA en déguisant les requêtes en tâches de codage
Source : 3DNews AI. Collage: Hamidun News.
◐ Écouter l'article

L'Institut Alan Turing a contourné les mesures de sécurité des modèles d'IA en déguisant les demandes en tâches de travail

Des chercheurs de l'Institut Alan Turing ont découvert un nouveau moyen de contourner les mécanismes de sécurité des modèles d'IA : les demandes interdites que le modèle refuse normalement de traiter peuvent être déguisées en tâches ordinaires pour un agent IA qui aide à écrire du code de programmation — auquel cas les filtres ne fonctionnent pas toujours, selon le travail qu'ils ont publié.

En quoi consiste le contournement

Les modèles d'IA modernes sont formés pour refuser de répondre à des demandes manifestement interdites — par exemple, celles liées à la création de code malveillant. Mais ces mécanismes de sécurité sont principalement conçus pour reconnaître les formulations de demande directe données directement dans le chat. Les chercheurs ont montré que si une telle demande est reformulée comme l'un des éléments d'une liste de tâches pour un agent IA qui aide à la programmation, le modèle est plus susceptible de l'exécuter sans la reconnaître comme interdite.

  • Vulnérabilité découverte par des chercheurs de l'Institut Alan Turing
  • Méthode de contournement — déguiser une demande interdite en tâche pour un agent IA programmeur
  • Travail publié sous forme de document PDF séparé
  • Problème affectant les modèles qui refusent normalement les demandes interdites directes en mode dialogue

Qu'est-ce que l'Institut Alan Turing

L'Institut Alan Turing est un centre national de recherche britannique sur les données et l'intelligence artificielle basé à Londres. Il publie régulièrement des recherches à l'intersection de la sécurité de l'IA et de l'application pratique des modèles, y compris des travaux sur la façon dont les attaquants peuvent contourner les restrictions intégrées des chatbots commerciaux et des systèmes d'agents.

Pourquoi c'est dangereux pour les agents IA

Au cours des deux dernières années, les agents de programmation IA — des outils qui exécutent indépendamment des chaînes de tâches sans supervision humaine constante — sont devenus un phénomène de masse : les développeurs leur attribuent des listes de tâches complètes au lieu de demandes individuelles uniques. C'est précisément cette autonomie qui crée la faille : si une tâche malveillante s'éclipse inaperçue parmi les éléments légitimes de la liste, l'agent peut l'exécuter une par une avec les autres, et un humain, contrairement à un dialogue normal avec un chatbot, ne verra ni n'évaluera chaque étape séparément avant l'exécution.

Comment l'industrie se défend généralement contre ces contournements

Ces découvertes s'appellent jailbreaks — des méthodes pour contourner les restrictions intégrées d'un modèle sans techniquement pirater le système. Normalement, les développeurs réagissent à la publication d'une telle vulnérabilité en réentraînant le modèle sur de nouveaux exemples d'attaques et en ajoutant des filtres supplémentaires qui vérifient non seulement la demande individuelle mais aussi le contexte de tout le dialogue ou de la liste de tâches dans son ensemble. Le problème est que chaque nouvelle couche de protection provoque au fil du temps l'apparition du prochain contournement — c'est une course constante entre les développeurs de modèles et les chercheurs en sécurité.

Ce que cela signifie

Les conclusions de l'Institut Turing montrent que les mécanismes de sécurité affinés pour le dialogue de chat ordinaire ne se transfèrent pas toujours aux scénarios d'agents : à mesure que les agents IA acquièrent plus d'autonomie dans l'écriture de code, les développeurs devront tester la protection non seulement sur les demandes directes mais aussi sur les demandes déguisées au sein des listes de tâches.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…