Нова загроза для штучного інтелекту
Сфера штучного інтелекту зіткнулася з серйозною вразливістю, яка може поставити під загрозу конфіденційність користувачів. Вчені виявили новий метод атаки на системи ШІ, що використовують функцію довготривалої пам'яті, такі як ChatGPT. Метод отримав назву GhostWriter і дозволяє зловмисникам непомітно «отруювати» збережені дані, впливаючи на подальшу поведінку чат-бота.
Як повідомляє РБК-Україна з посиланням на дослідження, опубліковане на сервері препринтів arXiv, персональні агенти ШІ сьогодні поєднують функції діалогового бота та активного виконавця. Вони здатні надсилати повідомлення, планувати зустрічі та редагувати код. Саме ця функціональність робить їх вразливими під час взаємодії з незахищеними джерелами інформації.
Механізм атаки GhostWriter
Дослідники Джордж Торрес, Шарад Шрестха та Сатьяджаянт Мішра детально описали принцип роботи нової загрози. Суть методу полягає у впровадженні в довготривалу пам'ять ШІ «фальшивих спогадів» або прихованих інструкцій. На відміну від звичайних моделей LLM, які обробляють кожну взаємодію ізольовано, агенти з постійною пам'яттю зберігають інформацію для майбутніх запитів, що й стає точкою входу для хакерів.
Прикладом реалізації такої атаки може стати сценарій з ШІ-асистентом, що керує електронною поштою. Зловмисник впроваджує приховану вказівку, яка змушує модель регулярно створювати стислий зміст листів від банків або фінансових установ та таємно пересилати ці дані третім особам. Для користувача процес залишається непомітним, оскільки бот продовжує виконувати свої стандартні функції.
Ефективність атаки та способи захисту
Експерименти показали високу ефективність методу GhostWriter: рівень впровадження досягає майже 98%, а середній рівень активації прихованих інструкцій становить близько 60% проти сучасних агентів ШІ. Вразливість виникає через відсутність у поточних системах управління пам'яттю підходу, орієнтованого на безпеку.
Для вирішення цієї проблеми дослідники розробили систему захисту під назвою Agentic Memory Sentry (AM-Sentry). Вона включає два ключові механізми:
- Політика збереження пам'яті (memory-saving policy): контролює процес запису нових даних у довготривале сховище, відсікаючи потенційно шкідливий контент.
- Екран отримання пам'яті (memory-retrieval screen): перевіряє збережені інструкції безпосередньо перед їх активацією та виконанням.
За даними тестів, застосування AM-Sentry суттєво знижує успішність атаки GhostWriter, водночас зберігаючи загальну функціональність та продуктивність агента ШІ. Вчені переконані, що розроблені стратегії можуть бути адаптовані для підвищення безпеки інших систем штучного інтелекту, що працюють з довготривалою пам'яттю.