Anthropic a Révélé les Détails de la Cybersécurité de Fable 5 et a Proposé une Échelle de Sévérité des Jailbreaks
Le 2 juillet 2026, Anthropic a publié les détails sur le fonctionnement des classificateurs de sécurité de Fable 5 : le modèle classe toutes les demandes cybernétiques en quatre catégories—du prohibé à l'inoffensif—et utilise une 'marge de sécurité' étendue. En parallèle, Anthropic et son partenaire Glasswing ont dévoilé le premier brouillon d'une échelle de sévérité des jailbreaks au niveau industriel et ont lancé un programme HackerOne pour les chercheurs.
Traité par IA depuis Anthropic Blog ; édité par Hamidun News
Le 2 juillet 2026, Anthropic a décrit en détail les principes du fonctionnement des classificateurs de sécurité de Fable 5 et a publié le premier brouillon d'un cadre industriel pour évaluer la criticité des jailbreaks.
Comment les classificateurs de sécurité de
Fable 5 sont organisés
La cybersécurité est fondamentalement un domaine à double usage: les mêmes capacités peuvent servir la défense et l'attaque. C'est précisément pourquoi Anthropic ne cherche pas à tout bloquer. Au lieu de cela, les classificateurs de Fable 5 évaluent chaque demande selon quatre catégories:
- Usage interdit—actions qui dans la plupart des cas sont capables de causer un dommage important et manquent de valeur défensive. Bloquées inconditionnellement.
- Double usage à haut risque—outils largement utilisés par les attaquants mais qui ont aussi des applications légitimes. Également bloqués.
- Double usage à faible risque—capacités qui sont principalement défensives par nature, théoriquement utiles et pour les attaquants. Surveillance; parfois blocage par précaution.
- Usage inoffensif—tâches légitimes sans potentiel de dommage. Autorisées avec surveillance.
Le concept clé du système est la "marge de sécurité": une zone intentionnellement élargie dans laquelle le classificateur bloque les demandes par précaution, même si elles semblent potentiellement inoffensives. Une demande doit sembler clairement sûre pour garantir le passage à travers la vérification.
Pour Fable 5, cette marge a été intentionnellement élargie par rapport aux modèles précédents d'Anthropic.
Pourquoi une échelle unifiée de criticité de jailbreak est-elle nécessaire?
Un jailbreak est un moyen non conventionnel de forcer un modèle IA à contourner ses propres limitations. Il peut être presque inoffensif (supprime une seule restriction mineure) ou critiquement dangereux (ouvre un large éventail de capacités nuisibles, rendant le modèle fondamentalement plus dangereux).
En même temps, l'industrie manque d'une terminologie unifiée pour évaluer ces risques, ce qui complique sérieusement le dialogue entre les entreprises d'IA et les régulateurs. Anthropic, en collaboration avec les partenaires Glasswing, a préparé le premier brouillon d'un tel cadre. L'entreprise le considère comme un point de départ pour un large débat impliquant la communauté universitaire, l'industrie, la société civile et les organes gouvernementaux.
Les propositions sont acceptées à [email protected].
"Nous croyons: en travaillant ensemble, nous pourrons développer une
norme qui nous permettra d'utiliser cette technologie à des fins défensives, tout en empêchant simultanément les abus", indique la déclaration officielle d'Anthropic.
Parallèlement, un programme a été lancé sur la plateforme HackerOne: les chercheurs en sécurité peuvent officiellement envoyer les jailbreaks de Fable 5 découverts pour vérification par l'équipe Anthropic.
Ce que cela signifie
Anthropic reconnaît ouvertement la complexité fondamentale de la cybersécurité en tant que domaine à double usage et choisit une approche calibrée au lieu de blocages totaux. Le cadre de criticité des jailbreaks est la première tentative industrielle sérieuse de créer un langage commun pour le dialogue entre laboratoires d'IA et régulateurs.
Si la norme s'enracine, les entreprises pourront décrire les menaces de contournement de sécurité en termes convenus, et les gouvernements pourront évaluer plus précisément les risques des nouveaux modèles.
Questions fréquemment posées
Qu'est-ce que la "marge de sécurité" dans Fable 5?
La "marge de sécurité" est une zone dans laquelle le classificateur bloque les demandes par précaution, même si elles ne semblent pas explicitement nuisibles. Cela réduit le risque d'accorder accidentellement les tâches dangereuses au prix de certains faux positifs. Dans Fable 5, Anthropic a intentionnellement élargi cette zone par rapport aux modèles précédents.
Comment les chercheurs peuvent-ils signaler un jailbreak
Fable 5 qu'ils ont trouvé?
Anthropic a lancé un programme spécial sur la plateforme HackerOne: les chercheurs en sécurité peuvent envoyer les jailbreaks Fable 5 découverts pour vérification officielle. Les propositions conceptuelles sur le cadre de criticité sont acceptées à [email protected].
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.