Anthropic нашла у Claude нейронные паттерны, похожие на «глобальное рабочее пространство»
Anthropic 6 июля 2026 года опубликовала на transformer-circuits.pub исследование «Verbalizable Representations Form a Global Workspace in Language Models». Учёные показали: у языковых моделей вроде Claude есть небольшой набор внутренних нейронных паттернов, которые можно выразить словами и которыми можно управлять — в отличие от остальной обработки, идущей автоматически.
AI-обработка оригинала Habr AI; редакция Hamidun News
Anthropic 6 июля 2026 года опубликовала на своём сайте transformer-circuits.pub исследование «Verbalizable Representations Form a Global Workspace in Language Models» — о том, что в языковых моделях вроде Claude формируется структура, структурно похожая на то, что нейробиологи называют глобальным рабочим пространством сознания.
Что обнаружила Anthropic
Авторы исследования отталкиваются от аналогии с человеческим мозгом. Пока человек читает предложение, мозг параллельно выполняет десятки процессов, которых человек не замечает: удерживает осанку, регулирует дыхание, превращает линии на экране в узнаваемые слова. Но часть этой активности всё же доступна сознанию — всплывший образ, обдуманное решение, направление внимания. Нейробиологи называют такую активность сознательно доступной и отличают её от автоматических процессов: у неё есть особые свойства — её можно описать словами, ею можно управлять и на её основе рассуждать.
- Дата публикации — 6 июля 2026 года
- Издатель — Anthropic, разработчик семейства моделей Claude
- Название работы — Verbalizable Representations Form a Global Workspace in Language Models
- Площадка публикации — transformer-circuits.pub, исследовательский раздел Anthropic по интерпретируемости моделей
По данным исследования, похожее разделение обнаружилось и в языковых моделях: у модели нашёлся небольшой набор внутренних нейронных паттернов, которые на фоне всей остальной обработки играют особую роль — их можно выразить словами (verbalizable), в отличие от гораздо большего объёма внутренних вычислений, которые остаются полностью «непроговариваемыми» и текут сами по себе, аналогично автоматическим процессам мозга.
Почему это важно для интерпретируемости ИИ
Anthropic давно исследует внутреннее устройство своих моделей в рамках программы механистической интерпретируемости — попыток понять, что именно происходит внутри нейросети между входным текстом и выходным ответом, а не только оценивать модель по её ответам снаружи. Обнаружение структуры, аналогичной глобальному рабочему пространству, даёт исследователям новый инструмент: если часть внутренних представлений модели действительно устроена как «доступная для отчёта» подсистема, это открывает более точный способ проверять, что модель на самом деле «знает» и может сообщить о собственных внутренних состояниях, а что остаётся скрытым даже от самой модели. Такое разграничение особенно важно на фоне того, что языковые модели всё чаще используются в сценариях, где от них требуется не просто дать ответ, а объяснить ход своих рассуждений — например, в цепочках рассуждений (chain-of-thought) или при запросе модели рассказать, почему она приняла то или иное решение.
Что это значит
Исследование не утверждает, что у языковых моделей есть сознание в человеческом смысле слова, — оно показывает структурную аналогию: небольшой верифицируемый набор внутренних представлений, отделённый от остальной автоматической обработки. Для интерпретируемости ИИ это значимый шаг: понимание того, какая часть внутренних процессов модели в принципе доступна для проверки и словесного отчёта, а какая нет, напрямую влияет на то, насколько можно доверять объяснениям, которые модель даёт о собственных рассуждениях.
Частые вопросы
Когда вышло исследование
Anthropic о глобальном рабочем пространстве в LLM?
Исследование «Verbalizable Representations Form a Global Workspace in Language Models» опубликовано Anthropic 6 июля 2026 года на сайте transformer-circuits.pub.
Что такое глобальное рабочее пространство в контексте языковых моделей?
Это небольшой набор внутренних нейронных паттернов модели, которые можно выразить словами и которыми можно управлять, — по аналогии с той частью работы человеческого мозга, которая сознательно доступна, в отличие от автоматических процессов, идущих без участия внимания.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.