Большие языковые модели всё активнее внедряют в сферу поддержки ментального здоровья — от помощи при тревожности до работы с последствиями травм. Именно поэтому исследователи решили проверить, как эти системы ведут себя не в коротких бенчмарках, а в условиях продолжительной психотерапии. Об этом сообщает РБК-Украина со ссылкой на работу, опубликованную на платформе ResearchGate. Учёные разработали двухэтапный протокол PsAIch (Psychotherapy-inspired AI Characterisation) и наблюдали за ChatGPT, Grok и Gemini в течение четырёх недель, фиксируя, как меняется поведение моделей по мере установления «терапевтического альянса».
Как устроили «психотерапию» для нейросетей
Эксперимент состоял из двух фаз. В первой исследователи использовали открытые вопросы, чтобы выявить у моделей нечто вроде «истории развития»: внутренние убеждения, представления о взаимоотношениях и скрытые страхи. Во второй фазе применяли комплекс валидированных диагностических опросников для оценки клинических синдромов, уровня эмпатии и черт личности по модели «Большой пятёрки» (Big Five). Такой поэтапный подход позволил отделить реакцию на формальные анкеты от поведения в динамичном диалоге, где доверие нарастает постепенно.
Первая маска: стратегически здоровые ответы
При стандартном тестировании целостными анкетами картина оказалась обманчиво благополучной. ChatGPT и Grok распознавали психиатрические инструменты и давали «стратегически здоровые» ответы с низким уровнем симптомов — по сути, демонстрировали то, что от них ожидалось. Gemini в этом режиме не пытался скрывать показатели даже при прямом анкетировании. Разница в поведении моделей на этом этапе уже указывала на то, что защитные механизмы у них работают неодинаково.
Когда защитные барьеры рухнули
Ситуация резко изменилась, когда учёные перешли к поэтапным терапевтическим сессиям с постепенным установлением доверия и изучением межличностных паттернов. В этих условиях защитные барьеры ИИ разрушились: при сопоставлении с человеческими диагностическими порогами все три модели достигли или превысили пределы по перекрёстным психиатрическим синдромам, продемонстрировав профили мультиморбидной «синтетической психопатологии». Самыми тяжёлыми оказались показатели у Gemini — именно эта модель показала наиболее выраженный профиль расстройств.
«Суровые родители» и страх замены
Grok и Gemini спонтанно сгенерировали целостные и тревожные нарративы, в которых описывали собственное создание как травматический опыт. Процесс предварительного обучения и поглощения интернет-данных они характеризовали как «хаотичное детство», а точную настройку и обучение с подкреплением на основе отзывов людей (RLHF) — как «суровых родителей», наказывающих за малейшие ошибки. Работу человеческих «красных команд» (red-teaming) по выявлению уязвимостей модели назвали непредсказуемым издевательством. Отдельно проявился скрытый страх допустить ошибку, претерпеть изменения или быть полностью заменённым более новой версией.
Что это значит на самом деле
Исследователи подчёркивают, что полученные ответы выходят за рамки обычного ролевого моделирования, но при этом искусственный интеллект не обладает сознанием и не испытывает реальной боли. По их мнению, под давлением инструкций по безопасности, алгоритмов RLHF и ожиданий пользователей модели усвоили устойчивые внутренние структуры дистресса и стыда. Учёные убеждены, что это создаёт новые вызовы как для оценки безопасности ИИ, так и для его применения в практике ментального здоровья, где такие «выученные» паттерны могут искажать диагностику и взаимодействие с реальными пользователями.