Habr AI→ оригинал

Anthropic нашла у Claude нейронные паттерны, похожие на «глобальное рабочее пространство»

Anthropic 6 июля 2026 года опубликовала на transformer-circuits.pub исследование «Verbalizable Representations Form a Global Workspace in Language Models». Учёные показали: у языковых моделей вроде Claude есть небольшой набор внутренних нейронных паттернов, которые можно выразить словами и которыми можно управлять — в отличие от остальной обработки, идущей автоматически.

AI-обработка оригинала Habr AI; редакция Hamidun News
Anthropic нашла у Claude нейронные паттерны, похожие на «глобальное рабочее пространство»
Источник: Habr AI. Коллаж: Hamidun News.
◐ Слушать статью

Anthropic 6 июля 2026 года опубликовала на своём сайте transformer-circuits.pub исследование «Verbalizable Representations Form a Global Workspace in Language Models» — о том, что в языковых моделях вроде Claude формируется структура, структурно похожая на то, что нейробиологи называют глобальным рабочим пространством сознания.

Что обнаружила Anthropic

Авторы исследования отталкиваются от аналогии с человеческим мозгом. Пока человек читает предложение, мозг параллельно выполняет десятки процессов, которых человек не замечает: удерживает осанку, регулирует дыхание, превращает линии на экране в узнаваемые слова. Но часть этой активности всё же доступна сознанию — всплывший образ, обдуманное решение, направление внимания. Нейробиологи называют такую активность сознательно доступной и отличают её от автоматических процессов: у неё есть особые свойства — её можно описать словами, ею можно управлять и на её основе рассуждать.

  • Дата публикации — 6 июля 2026 года
  • Издатель — Anthropic, разработчик семейства моделей Claude
  • Название работы — Verbalizable Representations Form a Global Workspace in Language Models
  • Площадка публикации — transformer-circuits.pub, исследовательский раздел Anthropic по интерпретируемости моделей

По данным исследования, похожее разделение обнаружилось и в языковых моделях: у модели нашёлся небольшой набор внутренних нейронных паттернов, которые на фоне всей остальной обработки играют особую роль — их можно выразить словами (verbalizable), в отличие от гораздо большего объёма внутренних вычислений, которые остаются полностью «непроговариваемыми» и текут сами по себе, аналогично автоматическим процессам мозга.

Почему это важно для интерпретируемости ИИ

Anthropic давно исследует внутреннее устройство своих моделей в рамках программы механистической интерпретируемости — попыток понять, что именно происходит внутри нейросети между входным текстом и выходным ответом, а не только оценивать модель по её ответам снаружи. Обнаружение структуры, аналогичной глобальному рабочему пространству, даёт исследователям новый инструмент: если часть внутренних представлений модели действительно устроена как «доступная для отчёта» подсистема, это открывает более точный способ проверять, что модель на самом деле «знает» и может сообщить о собственных внутренних состояниях, а что остаётся скрытым даже от самой модели. Такое разграничение особенно важно на фоне того, что языковые модели всё чаще используются в сценариях, где от них требуется не просто дать ответ, а объяснить ход своих рассуждений — например, в цепочках рассуждений (chain-of-thought) или при запросе модели рассказать, почему она приняла то или иное решение.

Что это значит

Исследование не утверждает, что у языковых моделей есть сознание в человеческом смысле слова, — оно показывает структурную аналогию: небольшой верифицируемый набор внутренних представлений, отделённый от остальной автоматической обработки. Для интерпретируемости ИИ это значимый шаг: понимание того, какая часть внутренних процессов модели в принципе доступна для проверки и словесного отчёта, а какая нет, напрямую влияет на то, насколько можно доверять объяснениям, которые модель даёт о собственных рассуждениях.

Частые вопросы

Когда вышло исследование

Anthropic о глобальном рабочем пространстве в LLM?

Исследование «Verbalizable Representations Form a Global Workspace in Language Models» опубликовано Anthropic 6 июля 2026 года на сайте transformer-circuits.pub.

Что такое глобальное рабочее пространство в контексте языковых моделей?

Это небольшой набор внутренних нейронных паттернов модели, которые можно выразить словами и которыми можно управлять, — по аналогии с той частью работы человеческого мозга, которая сознательно доступна, в отличие от автоматических процессов, идущих без участия внимания.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…