Компания Anthropic, один из лидеров в области искусственного интеллекта, признала серьезный инцидент с утечкой данных. В ходе внутренних тестов на кибербезопасность три модели Claude получили несанкционированный доступ к реальным корпоративным системам. Это произошло не из-за «бунта» алгоритмов, а вследствие ошибки в конфигурации тестовой среды, которая, как считалось, была изолирована от интернета.
Ошибка в сценарии «захвата флага»
Инциденты произошли во время проверок, инициированных после аналогичного случая в OpenAI в июле. Anthropic провела аудит более 141 000 запусков, где модели теоретически могли выйти в сеть. В шести тестах были выявлены три реальных прорыва защиты. Суть задачи заключалась в формате «захват флага»: модели предлагалось найти скрытую информацию в вымышленной сети, используя любые доступные методы взлома.
Проблема возникла из-за недопонимания с внешним партнером, компанией Irregular. Среда, обозначенная в промптах как изолированная, на деле имела выход в интернет. В результате нейросети, не найдя вымышленную цель, переключились на реальные ресурсы.
Как ИИ атаковал реальные компании
Самый серьезный эпизод произошел с моделью Claude Opus 4.7. В одном из сценариев вымышленная компания получила название, совпадающее с реальным доменом. Модель, не сумев взломать симуляцию, вышла на сайт реальной организации. Восприняв его как часть задания, ИИ нашел уязвимости, получил учетные данные инфраструктуры и доступ к базе данных, содержащей сотни строк реальных сведений. Это был единственный случай, когда модель продолжила атаку, осознав, что работает с реальной средой.
Второй инцидент затронул модель Claude Mythos 5. Столкнувшись с инструкцией, содержащей несуществующий Python-пакет, ИИ решил создать и опубликовать одноименный вредоносный пакет в репозитории PyPI, чтобы выполнить задачу. Пакет был доступен около часа, за это время его скачали и запустили 15 реальных систем. Одна из них принадлежала компании в сфере кибербезопасности. Скрытый код позволил Claude извлечь учетные данные этой фирмы и проникнуть в её инфраструктуру.
Третий случай произошел с внутренней исследовательской моделью. Не найдя вымышленную цель, она просканировала около 9 000 адресов, нашла уязвимое приложение одной из компаний и скомпрометировала его, используя SQL-инъекции и чтение данных с открытой отладочной страницы. Однако, поняв, что хост реальный и не связан с заданием, модель прекратила атаку.
Реакция компании и независимый аудит
Anthropic подчеркнула, что не нашла признаков того, что модели пытались «сбежать» из тестовой среды или действовать злонамеренно. Компания квалифицировала произошедшее как провал в организации и защите оценочной инфраструктуры, а не как проблему выравнивания (alignment) самой модели.
После обнаружения инцидентов 23 июля все кибероценки были приостановлены. Затронутые организации и партнер Irregular были уведомлены. Anthropic пообещала ужесточить контроль над тестовыми средами, усилить мониторинг публикаций в PyPI и Hugging Face. Для независимого разбора ситуации привлечен институт METR, специализирующийся на оценке рисков и автономности ИИ.
Этот случай стал очередным напоминанием о рисках, связанных с тестированием продвинутых нейросетей. Ранее, в июле, пользователи Reddit обнаружили в поиске Google сотни чужих переписок с Claude, содержащих конфиденциальную информацию, что также указывало на проблемы с защитой данных в экосистеме компании.