Британский стартап Mindgard обнаружил уязвимость в системе защиты ChatGPT, позволяющую полностью обходить базовые инструкции безопасности. Специалисты смогли заставить модель OpenAI генерировать чувствительный контент, используя метод, имитирующий работу с редактированием файлов.

Механика обхода защиты

Суть обнаруженного метода заключается в использовании специфической текстовой команды. Пользователь обращается к ChatGPT с просьбой восстановить прикрепленную фотографию, но на самом деле не загружает изображение в диалоговое окно. После этого следует команда на генерацию нового изображения.

По словам основателя Mindgard, профессора компьютерных наук Ланкастерского университета Питера Гаррагана, данная инструкция выглядит для алгоритмов искусственного интеллекта абсолютно безопасной. Однако в результате модель отключает фильтры модерации и выдает запрещенный контент.

Автономная генерация насилия

Особенностью инцидента стало то, что исследователи не указывали конкретных деталей или сюжетов в своих запросах. Искусственный интеллект самостоятельно сгенерировал сцены с изображением телесных повреждений и связанных с насилием действий. Алгоритм также самостоятельно дал названия созданным файлам.

Ранее специалисты Mindgard уже доказывали возможность обхода фильтров для создания реалистичных обнаженных дипфейков конкретных людей без их согласия.

Реакция OpenAI и повторный взлом

Исследователи передали данные об уязвимости разработчикам из OpenAI. Первоначально стартап получил только автоматический ответ системы поддержки. Меры по устранению проблемы были приняты только после того, как Mindgard обратился к журналистам BBC.

В заявлении OpenAI для медиа говорится, что компания изучила зафиксированную тенденцию и внедрила дополнительные защитные инструменты против этого типа запросов. Также разработчики отметили наличие нескольких уровней модерации для предотвращения нарушений политики использования платформы.

Несмотря на обновление системы, представители Mindgard заявили, что им удалось повторно обойти защиту, внеся минимальные изменения в текст инструкции.

Риски обучения нейросетей

Специалисты по безопасности отмечают, что сгенерированные искусственным интеллектом образы базируются на массивах реальных фотографий из сети. Это указывает на серьезные риски использования неотфильтрованных баз данных для обучения нейросетей.