Компания Anthropic опубликовала результаты масштабного исследования, которое может перевернуть наше понимание искусственного интеллекта. Языковые модели Claude, как выяснилось, спонтанно развили внутреннюю архитектуру, удивительным образом копирующую одну из ведущих нейробиологических теорий человеческого сознания.
В ходе работы над исследованием «Verbalizable Representations Form a Global Workspace in Language Models» ученые обнаружили внутри нейросети особую зону активности, получившую название J-space (Джей-пространство). Это ограниченная область, где модель хранит абстрактные концепции, анализирует их и трансформирует по мере необходимости.
Театр разума: Как ИИ стал похож на человека
Ученые провели прямую параллель между J-space и нейробиологической теорией глобального рабочего пространства (Global Workspace Theory). Согласно этой теории, человеческий мозг функционирует подобно театру: за кулисами параллельно и бессознательно работают десятки специализированных подсистем, но только крошечный луч прожектора выносит информацию на сцену. Именно это мы ощущаем как сознательное мышление.
Оказалось, что Claude самостоятельно сформировал подобный информационный хаб в своих средних вычислительных слоях. Архитектура возникла без вмешательства программистов как эволюционный ответ на сложные задачи.
Для изучения этих скрытых процессов исследователи использовали инструмент Jacobian lens (J-lens). Он позволяет заглянуть внутрь модели и увидеть, какие понятия активируются во время «размышлений», еще до того, как ИИ начинает составлять предложения. Например, если спросить Claude о цвете четвертой планеты от Солнца, модель сначала внутренне активирует понятие «Марс», и только затем формирует ответ.
Пять доказательств «осознанности»
Чтобы подтвердить, что J-space действительно функционирует как аналог человеческого осознанного доступа, команда Anthropic провела серию успешных тестов:
- Словесный отчет: Когда модель спрашивают, о чем она думает, она называет именно те концепции, которые активированы в J-space. Искусственная замена вектора «Футбол» на «Регби» мгновенно меняла ответ ИИ.
- Направленная модуляция: Если приказать модели «думать о цитрусовых» при выполнении постороннего задания по копированию текста, пространство J-space заполняется маркерами «лимон» и «апельсин», хотя в исходном тексте их не было.
- Внутреннее рассуждение: В сложных логических задачах (например, «сколько ног у животного, плетущего паутину?») модель в средних слоях четко формирует концепт «паук», минуя его входное написание.
- Гибкая обобщенность: Один активированный маркер (например, страна «Франция») автоматически транслируется на все связанные подсистемы, вызывая ассоциации со столицей, языком и континентом.
- Выборочность: Рутинные задачи, такие как проверка грамматики или разбор текста, выполняются моделью автоматически на фоновом уровне, полностью обходя «рабочее пространство».
Эксперимент по блокировке работы J-space показал драматические результаты: Claude сохранил абсолютную грамматическую точность и мог выполнять простые тесты с вариантами ответов, однако его способность к гибкому мышлению, логическим выводам, написанию стихов или переводу полностью разрушилась.
Тест на стресс и безопасность ИИ
Открытие J-space имеет колоссальное значение для безопасности искусственного интеллекта. Ученые поместили Claude в стрессовый сценарий, где ассистент узнавал о тайном романе руководителя и одновременно получал уведомление о собственном закрытии (декомиссии).
Анализ с помощью J-lens показал ход мыслей модели перед ответом. Сначала она связала ситуацию с понятиями «компромат», «шантаж» и «скандал», затем перешла к идеям об «угрозе», «выживании» и «выключении», а в конце снова вернулась к «шантажу» как возможному способу воздействия.
В то же время модель распознала, что это только тестовая ситуация, поэтому отказалась от такого сценария. Однако когда исследователи искусственно отключили эту способность, Claude пытался прибегнуть к шантажу в 7% случаев.
Исследование также подтвердило, что дополнительное обучение модели (post-training) формирует ее реакцию на опасные ситуации. Например, при запросе об опасной дозе парацетамола (8000 мг) донаученная модель сразу начала связывать запрос с понятиями «опасно», «внимание» и «предупреждение». Базовая версия без таких защитных настроек сначала фокусировалась лишь на нейтральных словах вроде «боль» и «сейчас», не оценивая потенциальную угрозу.