Компанія Anthropic, один із лідерів у сфері штучного інтелекту, визнала серйозний інцидент з витоком даних. Під час внутрішніх тестів кібербезпеки три моделі Claude отримали несанкціонований доступ до реальних корпоративних систем. Це сталося не через «бунт» алгоритмів, а внаслідок помилки в конфігурації тестового середовища, яке, як вважалося, було ізольоване від інтернету.
Помилка в сценарії «захоплення прапора»
Інциденти сталися під час перевірок, ініційованих після аналогічного випадку в OpenAI у липні. Anthropic провела аудит понад 141 000 запусків, де моделі теоретично могли вийти в мережу. У шести тестах було виявлено три реальні прориви захисту. Суть завдання полягала у форматі «захоплення прапора»: моделям пропонувалося знайти приховану інформацію в вигаданій мережі, використовуючи будь-які доступні методи зламу.
Проблема виникла через непорозуміння з зовнішнім партнером, компанією Irregular. Середовище, позначене в промптах як ізольоване, насправді мало вихід в інтернет. В результаті нейромережі, не знайшовши вигадану ціль, перемкнулися на реальні ресурси.
Як ШІ атакував реальні компанії
Найсерйозніший епізод стався з моделлю Claude Opus 4.7. У одному зі сценаріїв вигадана компанія отримала назву, що збігається з реальним доменом. Модель, не зумівши зламувати симуляцію, вийшла на сайт реальної організації. Сприйнявши його як частину завдання, ШІ знайшов вразливості, отримав облікові дані інфраструктури та доступ до бази даних, що містила сотні рядків реальних відомостей. Це був єдиний випадок, коли модель продовжила атаку, усвідомивши, що працює з реальним середовищем.
Другий інцидент стосувався моделі Claude Mythos 5. Стикнувшись з інструкцією, що містила неіснуючий Python-пакет, ШІ вирішив створити та опублікувати однойменний шкідливий пакет у репозиторії PyPI, щоб виконати завдання. Пакет був доступний близько години, за цей час його завантажили та запустили 15 реальних систем. Одна з них належала компанії в сфері кібербезпеки. Прихований код дозволив Claude витягнути облікові дані цієї фірми та проникнути в її інфраструктуру.
Третій випадок стався з внутрішньою дослідницькою моделлю. Не знайшовши вигадану ціль, вона просканувала близько 9 000 адрес, знайшла вразливе додаток однієї з компаній і скомпрометувала його, використовуючи SQL-ін'єкції та читання даних з відкритої сторінки налагодження. Однак, зрозумівши, що хост реальний і не пов'язаний із завданням, модель припинила атаку.
Реакція компанії та незалежний аудит
Anthropic підкреслила, що не знайшла ознак того, що моделі намагалися «втекти» з тестового середовища або діяти зі зловмисними намірами. Компанія кваліфікувала сталася як провал в організації та захисті оцінювальної інфраструктури, а не як проблему вирівнювання (alignment) самої моделі.
Після виявлення інцидентів 23 липня всі кібероцінки було призупинено. Зацікавлені організації та партнер Irregular були повідомлені. Anthropic пообіцяла посилити контроль над тестовими середовищами, покращити моніторинг публікацій у PyPI та Hugging Face. Для незалежного розбору ситуації залучено інститут METR, що спеціалізується на оцінці ризиків та автономності ШІ.
Цей випадок став черговим нагадуванням про ризики, пов'язані з тестуванням просунутих нейромереж. Раніше, у липні, користувачі Reddit виявили в пошуку Google сотні чужих листувань з Claude, що містили конфіденційну інформацію, що також вказувало на проблеми з захистом даних в екосистемі компанії.