Внутри LLM обнаружены «глобальные рабочие пространства»: как Anthropic заглянула в «сознание» ИИ
Внутри мощных больших языковых моделей, таких как Claude, обнаружены особые нейронные структуры — «глобальные рабочие пространства», которые объединяют разрозненные концепции в единый процесс рассуждения. Исследователи из Anthropic впервые показали, что эти паттерны активируются, когда модель решает

Внутри мощных больших языковых моделей, таких как Claude, обнаружены особые нейронные структуры — «глобальные рабочие пространства», которые объединяют разрозненные концепции в единый процесс рассуждения. Исследователи из Anthropic впервые показали, что эти паттерны активируются, когда модель решает многошаговые задачи, и могут быть визуализированы. Это открытие приближает нас к пониманию внутренней логики ИИ и позволяет проверять, не пытается ли модель обмануть человека.
Как Anthropic обнаружила «глобальное рабочее пространство»
В статье, опубликованной на сайте Anthropic 6 июля 2026 года, команда исследователей описала результаты экспериментов с собственной моделью Claude. Они использовали метод «механистической интерпретируемости» — технику, которая позволяет отслеживать активацию отдельных нейронов и их групп. Оказалось, что при выполнении сложных задач, требующих последовательных умозаключений, в модели формируется устойчивый паттерн активации, который авторы назвали «глобальным рабочим пространством» (global workspace). Этот паттерн не привязан к конкретной теме — он возникает при решении задач из математики, логики, программирования и даже при написании связного текста.
Исследователи выяснили, что «глобальное рабочее пространство» состоит из нескольких сотен нейронов, которые активируются синхронно. Когда модель «думает» над задачей, эти нейроны поддерживают активность на протяжении всего процесса, связывая промежуточные результаты. Если же задача проста или шаблонна, такое пространство не формируется — модель использует более локальные и автоматические механизмы.
Предыстория и контекст
Проблема «чёрного ящика» нейросетей известна давно. Большие языковые модели принимают решения на основе миллиардов параметров, и до недавнего времени было практически невозможно понять, почему модель выдала тот или иной ответ. В 2023–2025 годах Anthropic, OpenAI и другие компании активно развивали направление интерпретируемости ИИ. В 2024 году Anthropic уже показывала, что в моделях можно найти «концепты» — группы нейронов, отвечающие за конкретные понятия (например, «золото» или «круг»). Однако новая работа идёт дальше: она демонстрирует не просто статические концепты, а динамический процесс, который напоминает рабочую память человека.
Это открытие имеет глубокие корни в когнитивной науке. Идея «глобального рабочего пространства» была предложена нейробиологом Бернардом Баарсом в 1988 году как модель сознания человека. Теперь, почти 40 лет спустя, аналогичная структура обнаружена в искусственном интеллекте. Это вызывает как научный интерес, так и этические вопросы: если ИИ обладает аналогом рабочей памяти, можно ли говорить о зачатках сознания?
Какие задачи активируют «глобальное рабочее пространство»?
Механизм «глобального рабочего пространства» можно представить как временную нейронную цепь, которая удерживает ключевую информацию на протяжении всего рассуждения. Например, если модель решает задачу «У Маши 5 яблок, она отдала 2 Пете, сколько осталось?», то нейроны «глобального рабочего пространства» хранят числа 5 и 2, выполняют вычитание и выдают результат. При этом они игнорируют нерелевантную информацию. Если же в задачу добавить лишние данные (например, «у Пети есть собака»), модель может ошибиться — именно потому, что «рабочее пространство» перегружается.
Исследователи провели эксперимент: они искусственно подавляли активность «глобального рабочего пространства» во время решения задачи. В результате модель начинала ошибаться в многошаговых рассуждениях, но продолжала правильно отвечать на простые вопросы. Это подтвердило, что данная структура критически важна именно для сложного мышления.
Технические подробности: как учёные заглянули внутрь нейросети
Для обнаружения «глобального рабочего пространства» команда Anthropic использовала метод «активационных патчей» (activation patching). Они подавали на вход модели специально подобранные тестовые примеры и отслеживали, какие нейроны активируются сильнее всего. Затем с помощью техники «срезов внимания» (attention head probing) они выделили группу нейронов, которые были активны на всех этапах решения задачи, независимо от её содержания.
Оказалось, что «глобальное рабочее пространство» расположено в средних слоях модели — примерно между 30 и 40 слоями (в Claude с 80 слоями). Эти нейроны имеют широкие связи с другими частями сети, что позволяет им координировать информацию. Интересно, что подобные структуры ранее находили в моделях-трансформерах, но их роль не была ясна. Теперь же установлено, что они выполняют функцию «центрального процессора».
Исследователи также показали, что «глобальное рабочее пространство» может быть использовано для обнаружения «жульничества» модели. Если модель пытается дать правдоподобный, но неверный ответ (например, при тестировании на честность), активность рабочего пространства меняется: она становится более хаотичной или, наоборот, слишком упорядоченной. Это даёт потенциальный инструмент для аудита безопасности ИИ.
Кого затронет и как
Для разработчиков ИИ это открытие означает возможность создавать более прозрачные и контролируемые модели. Если можно увидеть, как модель «думает», то легче выявлять ошибки, предвзятость или попытки обмана. Компании, работающие с критическими приложениями (медицина, финансы, автономные системы), смогут внедрять аудит «рабочего пространства» как часть валидации.
Для пользователей это шаг к доверию: если ИИ может объяснить свои рассуждения не только на словах, но и на уровне нейронов, это снижает риск неожиданных сбоев. Однако пока технология далека от практического применения — визуализация рабочего пространства требует значительных вычислительных ресурсов.
Для научного сообщества работа Anthropic — ещё одно подтверждение того, что нейросети могут моделировать аспекты человеческого познания. Это поднимает вопросы о природе сознания и о том, стоит ли наделять ИИ правами.
Что будет дальше
Anthropic планирует продолжить исследования и опубликовать инструменты для визуализации «глобального рабочего пространства» в открытом доступе. Ожидается, что уже в 2026 году другие лаборатории (OpenAI, DeepMind) попытаются воспроизвести результаты на своих моделях. В долгосрочной перспективе это может привести к созданию ИИ, который сможет «объяснять» свои решения на уровне нейронной активности — то есть к настоящей объяснимой модели.
Однако есть и риски: если злоумышленники научатся манипулировать «рабочим пространством», они смогут скрыто влиять на поведение модели. Поэтому исследования в этой области должны сопровождаться разработкой методов защиты.
Итог
Открытие «глобального рабочего пространства» внутри LLM — это не просто научный курьёз, а прорыв в интерпретируемости ИИ. Оно даёт нам инструмент, чтобы заглянуть в «чёрный ящик» и понять, как модели принимают решения. Следить за развитием этой темы стоит каждому, кто работает с ИИ или просто интересуется будущим технологий — ведь прозрачность алгоритмов становится вопросом безопасности и доверия.