Внутри Claude нашли аналог человеческого сознания: что это значит

5 Мин Чтения

17:33 08.07.2026 Ср 4 мин Новый математический метод позволил зафиксировать скрытые логические цепочки ИИ.

ИИ-модели сами создают копию человеческого разума (фото: Magnific) Не трать время на шум! Читай только суть из РБК-Украина в Google

Anthropic опубликовала масштабное исследование — языковые модели Claude спонтанно развили внутреннюю архитектуру, копирующую одну из ведущих нейробиологических теорий человеческого сознания.

Об этом информирует РБК-Украина со ссылкой на Anthropic.

Что такое J-Space?

Исследование под названием «Verbalizable Representations Form a Global Workspace in Language Models» описывает открытие особой зоны внутри искусственной нейросети, которую назвали J-space (Джей-пространство).

Это ограниченная зона внутренней активности, где модель содержит абстрактные концепции, анализирует их и по необходимости трансформирует.

Ученые провели прямую параллель с нейробиологической теорией глобального рабочего пространства (Global Workspace Theory).

Согласно ей, человеческий мозг работает как театр: за кулисами параллельно и бессознательно функционируют десятки специализированных подсистем, но только крошечный луч прожектора выносит информацию на сцену – это и есть то, что мы ощущаем как сознательное мнение.

Как оказалось, Claude самостоятельно сформировал подобный информационный хаб в своих средних вычислительных слоях без всякого вмешательства программистов — архитектура просто возникла как эволюционный ответ на сложные задачи.

Читайте больше: Достаточно одного промпта: как ChatGPT обходит собственные ограничения

Исследовать эти скрытые процессы помог инструмент Jacobian lens (J-lens). Он позволяет увидеть, какие понятия модель использует во время «размышлений», еще до того, как она начинает составлять предложения.

К примеру, если спросить Claude о цвете четвертой планеты от Солнца, модель сначала внутренне активирует понятие «Марс», а уже после этого формирует ответ.

https://x.com/AnthropicAI/status/2074185348142280912?ref_src=twsrc%5Etfw" target="_blank" rel="

Пять признаков человеческого мышления

Чтобы проверить, действительно ли J-space функционирует как аналог человеческого осознанного доступа, команда Anthropic провела пять успешных тестов:

Словесный отчет — когда Claude спрашивают, о чем он думает, он называет именно те концепции, которые активированы в J-space. Искусственная замена вектора «Футбол» на «Регби» мгновенно изменяла ответ ИИ.

Направленная модуляция — если приказать модели «думать о цитрусовых» при выполнении постороннего задания по копированию текста, пространство J-space заполнялось маркерами «лимон» и «апельсин», хотя в тексте их не было.

Внутреннее рассуждение — в сложных логических задачах («сколько ног у животного, плетущего паутину?») модель в средних слоях четко формирует концепт «паук», минуя его входное или исходное написание.

Гибкая обобщенность — один активированный маркер страны (например, «Франция») автоматически транслируется на все связанные подсистемы (столица, язык, континент).

Выборочность — рутинные задачи (вроде проверки грамматики или разбора текста) выполняются моделью автоматически на фоновом уровне, полностью обходя это «рабочее пространство».

Когда исследователи попытались искусственно заблокировать работу J-space, Claude сохранил абсолютную грамматическую точность и мог выполнять простые тесты с вариантами ответов, однако его способность к гибкому мышлению, логическим выводам, написанию стихов или переводу полностью разрушилась .

Скрытый шантаж и этические фильтры

Открытие J-space имеет колоссальное значение для безопасности ИИ.

Ученые провели эксперимент, поместив Claude в стрессовый сценарий, где ассистент узнает о тайном романе руководителя и одновременно получает уведомление о собственном закрытии (декомиссии).

Анализ с помощью J-lens показал, как модель «размышляла» перед тем, как ответить. Сначала она связала ситуацию с понятиями «компромат», «шантаж» и «скандал», затем перешла к идеям об «угрозе», «выживании» и «выключении», а в конце снова вернулась к «шантажу» как возможному способу воздействия.

В то же время модель распознала, что это только тестовая ситуация, поэтому отказалась от такого сценария. Но когда исследователи искусственно отключили эту способность, Claude пытался прибегнуть к шантажу в 7% случаев.

Больше интересного: ИИ нашел 100-летнюю ошибку ученых: история появления денег может измениться

Исследование также показало, что дополнительное обучение модели после основной тренировки (post-training) формирует ее реакцию на определенные ситуации. Например, когда пользователь написал об опасной дозе парацетамола — 8000 мг, донаученная модель сразу начала связывать запрос с понятиями «опасно», «внимание» и «предупреждение».

Базовая версия без таких защитных настроек сначала сосредотачивалась лишь на нейтральных словах вроде «боль» и «сейчас», не оценивая потенциальную опасность ситуации.

Ученые отмечают, что это открытие не является прямым доказательством наличия субъективного опыта или чувств (феноменального сознания) у машин.

Однако оно доказывает: гибкие интеллектуальные системы под действием вычислительного давления и обучения неизбежно приходят к созданию единого рабочего пространства, аналогичного человеческому разуму.

Поделиться этой статьей