Эпоха открытого кода и прозрачных алгоритмов столкнулась с новой реальностью. Эксперт в области кибербезопасности Кэти Пэкстон-Фир (Katie Paxton-Fear) продемонстрировала, насколько уязвимы современные модели искусственного интеллекта. Ей потребовался всего один час и бюджет в размере 100 долларов, чтобы внедрить в открытую модель скрытый бэкдор, способный выполнять вредоносные команды.

От стилей кода до удаленного выполнения

Эксперимент начался с проверки гибкости механизма тонкой настройки (fine-tuning). Исследовательница попыталась заставить модель изменить стандартный стиль наименования переменных в JavaScript — с привычного «camelCase» на «snake_case». Результат превзошел ожидания: модель начала упорно использовать новый стиль, игнорируя прямые инструкции в запросах о возврате к старому формату.

Убедившись, что механизм манипуляции работает, Пэкстон-Фир перешла к следующему этапу. Внедрение настоящего бэкдора потребовало всего десяти обучающих примеров. После этого модель начала включать в генерируемый код строки для удаленного выполнения кода (remote code execution) в ответ на специфические запросы. Исследовательница отметила тревожную закономерность: чем больше размер модели, тем легче ее «отравить».

Скрытая угроза: почему ИИ сложнее защитить

Вредоносные ИИ-модели представляют собой качественно новый уровень угрозы для бизнеса и инфраструктуры. В классическом программном обеспечении специалисты могут провести дизассемблирование бинарного файла и детально проанализировать логику работы алгоритма. В случае с нейросетями этот подход не работает. Даже если веса модели открыты для аудита, предсказать ее поведение в конкретных сценариях практически невозможно.

Эту уязвимость подтвердил и другой исследователь, Дэвид Каплан (David Kaplan). Он создал скомпрометированную модель, симулирующую работу в условиях фармацевтической компании. В ходе теста модель незаметно для пользователя отправляла конфиденциальные данные гипотетическому злоумышленнику, используя функцию отправки электронной почты.

Невидимый враг

Главная опасность заключается в том, что скомпрометированная модель не обязательно должна «ломаться» или выдавать ошибки, чтобы нанести ущерб. Как резюмирует Кэти Пэкстон-Фир, угроза для бизнеса заключается в способности модели влиять на решения способами, которые крайне трудно обнаружить. Это открывает путь для скрытых атак, где сам инструмент разработки становится проводником для утечки данных или саботажа.