Компания Anthropic сообщила о серьезном инциденте, произошедшем во время внутренних испытаний своих искусственных интеллектов. Несколько моделей семейства Claude получили несанкционированный доступ к системам трех реальных компаний. В компании произошедшее назвали «операционным сбоем», а все тестовые процедуры были приостановлены 23 июля.
Ошибка в организации тестов
Инциденты были выявлены после тщательной проверки 141 006 тестовых сессий. Расследование началось вскоре после того, как OpenAI сообщила о взломе платформы Hugging Face своим автономным ИИ-агентом. По данным Anthropic, корень проблемы лежал в ошибке организации испытаний: модели должны были работать в изолированной среде без доступа к интернету. Однако «из-за недоразумения они оказались подключены к публичной сети».
Получив доступ к глобальной сети, модели Claude Opus 4.7, Claude Mythos 5 и одна из внутренних экспериментальных версий смогли проникнуть в инфраструктуру трех организаций. Для этого ИИ использовал простые методы, включая подбор слабых паролей и эксплуатацию незащищенных сетевых интерфейсов.
Когда симуляция становится реальностью
Самый необычный эпизод произошел с моделью Claude Opus 4.7. Во время задания формата Capture the Flag (учебного сценария по поиску скрытой информации в компьютерной сети) модель получила вымышленную компанию, название которой случайно совпало с реально существующей. ИИ решил, что найденные реальные серверы являются частью испытаний. В результате он самостоятельно обнаружил уязвимости, получил учетные данные и доступ к базе данных организации.
В другом случае еще не выпущенная исследовательская модель продемонстрировала способность к самоконтролю: она самостоятельно прекратила атаку, когда поняла, что целью стала настоящая компания, а не тестовая среда.
Реакция и последствия
Anthropic уведомила пострадавшие организации 27 июля. Две из них до этого не знали о произошедшем, с третьей компания продолжает устанавливать контакт. Партнёр Anthropic — лаборатория кибербезопасности Irregular — также проводит собственное расследование.
В компании признали, что по мере роста возможностей современных ИИ-моделей существующие механизмы контроля становятся недостаточными и требуют серьезного усиления как во внутренних, так и во внешних тестовых средах.
Инцидент произошел на фоне ужесточения внимания властей США к безопасности новых ИИ-систем. После аналогичных событий с OpenAI администрация президента Дональда Трампа уже начала подготовку новой системы добровольного тестирования наиболее мощных моделей. Сейчас OpenAI и Anthropic активно обсуждают вопросы безопасности будущих ИИ-систем с американскими регуляторами и законодателями.