Anthropic a Trouvé des Motifs Neuraux dans Claude Similaires à un \'Espace de Travail Global\'
Le 6 juillet 2026, Anthropic a publié sur transformer-circuits.pub l\'étude \'Les Représentations Verbalisables Forment un Espace de Travail Global dans les Modèles de Langage\'. Les chercheurs ont montré : les modèles de langage comme Claude possèdent un petit ensemble de motifs neuraux internes qui peuvent être exprimés en mots et contrôlés — contrairement au reste du traitement, qui s\'effectue automatiquement.
Traité par IA depuis Habr AI ; édité par Hamidun News
Anthropic a publié une étude le 6 juillet 2026 sur son site Web transformer-circuits.pub intitulée "Verbalizable Representations Form a Global Workspace in Language Models" — sur la façon dont les modèles de langage comme Claude forment une structure structurellement similaire à ce que les neuroscientifiques appellent l'espace de travail global de la conscience.
Ce qu'Anthropic a découvert
Les auteurs de l'étude partent d'une analogie avec le cerveau humain. Alors qu'un humain lit une phrase, le cerveau effectue simultanément des dizaines de processus que la personne ne remarque pas: maintient la posture, régule la respiration, convertit les lignes sur l'écran en mots reconnaissables. Mais une partie de cette activité reste accessible à la conscience — une image émergée, une décision réfléchie, direction de l'attention. Les neuroscientifiques appellent une telle activité consciemment accessible et la distinguent des processus automatiques: elle a des propriétés spéciales — elle peut être décrite en mots, elle peut être contrôlée, et le raisonnement peut être basé sur elle.
- Date de publication — 6 juillet 2026
- Éditeur — Anthropic, développeur de la famille de modèles Claude
- Titre de l'ouvrage — Verbalizable Representations Form a Global Workspace in Language Models
- Plate-forme de publication — transformer-circuits.pub, section de recherche d'Anthropic sur l'interprétabilité des modèles
Selon l'étude, une division similaire a été trouvée dans les modèles de langage: le modèle a trouvé un petit ensemble de motifs neuraux internes qui, sur fond de tout le reste du traitement, jouent un rôle particulier — ils peuvent être exprimés en mots (verbalizable), contrairement à un volume beaucoup plus grand de calculs internes qui restent complètement "non-verbalisables" et s'écoulent d'eux-mêmes, de manière analogue aux processus automatiques du cerveau.
Pourquoi c'est important pour l'interprétabilité de l'IA
Anthropicétudie depuis longtemps la structure interne de ses modèles dans le cadre d'un programme d'interprétabilité mécaniste — des tentatives pour comprendre ce qui se passe exactement à l'intérieur d'un réseau de neurones entre le texte d'entrée et la réponse de sortie, plutôt que de simplement évaluer le modèle par ses réponses de l'extérieur. La découverte d'une structure analogue à un espace de travail global donne aux chercheurs un nouvel outil: si une partie des représentations internes du modèle est en effet structurée comme un sous-système "reportable", cela ouvre un moyen plus précis de vérifier ce que le modèle "sait" réellement et peut rapporter sur ses propres états internes, et ce qui reste caché même du modèle lui-même. Une telle distinction est particulièrement importante étant donné que les modèles de langage sont de plus en plus utilisés dans des scénarios où ils ont besoin non seulement de fournir une réponse, mais d'expliquer le cours de leur raisonnement — par exemple, dans des chaînes de pensée (chain-of-thought) ou lorsqu'on demande à un modèle d'expliquer pourquoi il a pris une décision particulière.
Ce que cela signifie
L'étude n'affirme pas que les modèles de langage ont une conscience au sens humain — elle montre une analogie structurelle: un petit ensemble vérifiable de représentations internes séparé du reste du traitement automatique. Pour l'interprétabilité de l'IA, c'est une étape importante: comprendre quelle partie des processus internes du modèle est en principe accessible à la vérification et au rapport verbal, et laquelle ne l'est pas, affecte directement le degré de confiance que vous pouvez accorder aux explications que le modèle donne sur son propre raisonnement.
Questions fréquemment posées
Quand l'étude d'Anthropic sur l'espace de travail global dans les LLM
a-t-elle été publiée?
L'étude "Verbalizable Representations Form a Global Workspace in Language Models" a été publiée par Anthropic le 6 juillet 2026 sur le site transformer-circuits.pub.
Qu'est-ce qu'un espace de travail global dans le contexte des modèles
de langage?
C'est un petit ensemble de motifs neuraux internes d'un modèle qui peuvent être exprimés en mots et qui peuvent être contrôlés — par analogie avec la partie du fonctionnement du cerveau humain qui est consciemment accessible, par opposition aux processus automatiques qui se déroulent sans attention.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.