Новая угроза для искусственного интеллекта
Сфера искусственного интеллекта столкнулась с серьезной уязвимостью, способной поставить под угрозу конфиденциальность пользователей. Ученые обнаружили новый метод атаки на ИИ-системы, использующие функцию долговременной памяти, такие как ChatGPT. Метод получил название GhostWriter и позволяет злоумышленникам незаметно «отравлять» сохраненные данные, влияя на дальнейшее поведение чат-бота.
Как сообщает РБК-Украина со ссылкой на исследование, опубликованное на сервере препринтов arXiv, персональные ИИ-агенты сегодня совмещают функции диалогового бота и активного исполнителя. Они способны отправлять сообщения, планировать встречи и редактировать код. Именно эта функциональность делает их уязвимыми при взаимодействии с незащищенными источниками информации.
Механизм атаки GhostWriter
Исследователи Джордж Торрес, Шарад Шрестха и Сатьяджаянт Мисра детально описали принцип работы новой угрозы. Суть метода заключается во внедрении в долговременную память ИИ «фальшивых воспоминаний» или скрытых инструкций. В отличие от обычных LLM-моделей, которые обрабатывают каждое взаимодействие изолированно, агенты с постоянной памятью сохраняют информацию для будущих запросов, что и становится точкой входа для хакеров.
Примером реализации такой атаки может стать сценарий с ИИ-ассистентом, управляющим электронной почтой. Злоумышленник внедряет скрытое указание, заставляющее модель регулярно создавать краткое содержание писем от банков или финансовых учреждений и тайно пересылать эти данные третьим лицам. Для пользователя процесс остается незаметным, так как бот продолжает выполнять свои стандартные функции.
Эффективность атаки и способы защиты
Эксперименты показали высокую эффективность метода GhostWriter: уровень внедрения достигает почти 98%, а средний уровень активации скрытых инструкций составляет около 60% против современных ИИ-агентов. Уязвимость возникает из-за отсутствия в текущих системах управления памятью, ориентированного на безопасность подхода.
Для решения этой проблемы исследователи разработали систему защиты под названием Agentic Memory Sentry (AM-Sentry). Она включает два ключевых механизма:
- Политика сохранения памяти (memory-saving policy): контролирует процесс записи новых данных в длительное хранилище, отсекая потенциально вредоносный контент.
- Экран извлечения памяти (memory-retrieval screen): проверяет сохраненные инструкции непосредственно перед их активацией и выполнением.
По данным тестов, применение AM-Sentry существенно снижает успешность атаки GhostWriter, при этом сохраняя общую функциональность и производительность ИИ-агента. Ученые убеждены, что разработанные стратегии могут быть адаптированы для повышения безопасности других систем искусственного интеллекта, работающих с долговременной памятью.