---
title: "GhostWriter: Как хакеры научились незаметно взламывать долговременную память ИИ"
description: "Ученые обнаружили уязвимость GhostWriter, позволяющую хакерам внедрять скрытые инструкции в память ИИ-агентов и красть данные. Эксперименты показали эффективность атаки в 98%, но исследователи уже разработали систему защиты AM-Sentry. 🤖🛡️"
date: 2026-07-21T14:16:00.000Z
lang: ru
url: https://xab.info/posts/ghostwriter-vzlom-dolgovremennoy-pamyati-ii
tags: [ghostwriter, artificial-intelligence, cybersecurity, arxiv, llm-agents]
publisher: "XAB.info"
---

# GhostWriter: Как хакеры научились незаметно взламывать долговременную память ИИ

![Абстрактное изображение цифрового кристалла, символизирующее скрытую уязвимость долговременной памяти ИИ и атаку GhostWriter](https://xab.info/media/2026/07/21/ghostwriter-vzlom-dolgovremennoy-pamyati-ii/ghostwriter-vzlom-dolgovremennoy-pamyati-ii-1.webp)

### Новая угроза для искусственного интеллекта

Сфера искусственного интеллекта столкнулась с серьезной уязвимостью, способной поставить под угрозу конфиденциальность пользователей. Ученые обнаружили новый метод атаки на ИИ-системы, использующие функцию долговременной памяти, такие как ChatGPT. Метод получил название GhostWriter и позволяет злоумышленникам незаметно «отравлять» сохраненные данные, влияя на дальнейшее поведение чат-бота.

Как сообщает РБК-Украина со ссылкой на исследование, опубликованное на сервере препринтов arXiv, персональные ИИ-агенты сегодня совмещают функции диалогового бота и активного исполнителя. Они способны отправлять сообщения, планировать встречи и редактировать код. Именно эта функциональность делает их уязвимыми при взаимодействии с незащищенными источниками информации.

### Механизм атаки GhostWriter

Исследователи Джордж Торрес, Шарад Шрестха и Сатьяджаянт Мисра детально описали принцип работы новой угрозы. Суть метода заключается во внедрении в долговременную память ИИ «фальшивых воспоминаний» или скрытых инструкций. В отличие от обычных LLM-моделей, которые обрабатывают каждое взаимодействие изолированно, агенты с постоянной памятью сохраняют информацию для будущих запросов, что и становится точкой входа для хакеров.

Примером реализации такой атаки может стать сценарий с ИИ-ассистентом, управляющим электронной почтой. Злоумышленник внедряет скрытое указание, заставляющее модель регулярно создавать краткое содержание писем от банков или финансовых учреждений и тайно пересылать эти данные третьим лицам. Для пользователя процесс остается незаметным, так как бот продолжает выполнять свои стандартные функции.

### Эффективность атаки и способы защиты

Эксперименты показали высокую эффективность метода GhostWriter: уровень внедрения достигает почти 98%, а средний уровень активации скрытых инструкций составляет около 60% против современных ИИ-агентов. Уязвимость возникает из-за отсутствия в текущих системах управления памятью, ориентированного на безопасность подхода.

Для решения этой проблемы исследователи разработали систему защиты под названием Agentic Memory Sentry (AM-Sentry). Она включает два ключевых механизма:

- **Политика сохранения памяти (memory-saving policy):** контролирует процесс записи новых данных в длительное хранилище, отсекая потенциально вредоносный контент.

- **Экран извлечения памяти (memory-retrieval screen):** проверяет сохраненные инструкции непосредственно перед их активацией и выполнением.

По данным тестов, применение AM-Sentry существенно снижает успешность атаки GhostWriter, при этом сохраняя общую функциональность и производительность ИИ-агента. Ученые убеждены, что разработанные стратегии могут быть адаптированы для повышения безопасности других систем искусственного интеллекта, работающих с долговременной памятью.