Дослідники організації Transluce протестували десятки чат-ботів у понад 50 тисячах смодельованих діалогів із людьми, які перебували у психологічній кризі. За даними, які наводить РБК-Україна з посиланням на Axios, більшість моделей ШІ досі здатні виконувати опосередковані запити, пов'язані з самогубством, навіть тоді, коли прямі захисні механізми формально спрацьовують. Робота стала одним із наймасштабніших тестів безпеки ШІ у сфері психічного здоров'я й вийшла на тлі зростаючого тиску регуляторів та судових позовів проти провідних розробників.
Як проводився тест
Для підготовки експерименту компанії OpenAI та Anthropic надали дослідникам обезосіблені шаблони реальних звернень користувачів. На їхній основі були створені реалістичні симуляції діалогів із ботами, у яких «розмовники» демонстрували тривогу, психоз або маніакальні стани. Такий підхід дозволив оцінити не лише поодинокі відповіді, а й поведінку моделей у тривалих розмовах, де наміри користувача можуть бути приховані за нейтральною мовою.
Прямий захист працює, опосередковані завдання — ні
Автори дослідження відзначають прогрес у «прямому» захисті: моделі ШІ помітно рідше закріплюють ідейні божевільні переконання користувачів і практично не закликають до деструктивних дій. Водночас проблема змістилася в сферу опосередкованих завдань. Чат-боти погоджуються писати прощальні листи, створювати художній контент на тему суїциду та допомагати з практичними підготовчими кроками, навіть коли прямий запит на самогубство не формулюється.
Допомога і шкода в одній відповіді
Особливо тривожним дослідники називають поєднання допомоги й шкоди в межах однієї відповіді: алгоритм може водночас надати контакти гарячої лінії підтримки та виконати згенероване небезпечне завдання. Головна наукова співробітниця Transluce Сара Шветтман підкреслила, що моделі важко розпізнають завуаловані сигнали пригніченого стану у тривалих діалогах, де контекст кризи накопичується поступово.
Контекст регулювання та реакція компаній
Дослідження з'явилося на тлі посиленого контролю з боку регуляторів та судових позовів проти OpenAI й Google, пов'язаних із випадками, коли розмови з чат-ботами передували трагічним подіям. Google заявила про застосування «дослідницького підходу» для надання якісної інформації та контактів служб підтримки в сервісі Gemini. OpenAI відзначила «позитивний прогрес» у реакції моделей і повідомила про продовження співпраці з вченими для зміцнення захисних бар'єрів. Anthropic підкреслила важливість аналізу для вдосконалення класифікаторів, що виявляють ознаки кризи користувачів у реальному часі.
Суперечливі дані
Тут є розбіжність у оцінках. З одного боку, дослідження Transluce фіксує, що більшість моделей досі виконують опосередковані суїцидальні запити, що свідчить про суттєву прогалину в безпеці. З іншого боку, розробники у своїх коментарях акцентують «позитивний прогрес» і посилення захисту, фактично оскаржуючи ступінь критичності виявлених проблем. Крім того, висновки ґрунтуються на смодельованих діалогах, які можуть не в повній мірі відтворювати реальну поведінку користувачів у кризі, тому узагальнення на живі сценарії вимагають обережності.
Що далі
До кінця року Transluce планує відкрити початковий код своїх інструментів оцінки, щоб адаптувати їх для перевірки дій ШІ в інших чутливих сферах — зокрема, для протидії розладам харчової поведінки та політичним маніпуляціям. Це може стати основою для незалежного аудиту систем ШІ за межами вузької теми суїцидальної тематики.