Компания Anthropic, разработчик языковой модели Claude, опубликовала отчёт, в котором зафиксировала серию реальных запросов, направленных на использование её ИИ-системы для разработки биологического и кибероружия. Согласно данным компании, злоумышленники обращались к модели с целью модификации патогенов, генерации токсинов и создания пропагандистского контента. В большинстве случаев подозрительные запросы были перехвачены и заблокированы внутренними системами безопасности, однако сам факт их появления в промышленных масштабах, по оценке экспертов, сигнализирует о качественно новом уровне угрозы, связанной с распространением передовых языковых моделей.
Вирус Чикунгунья и военный контекст
Один из наиболее детально описанных кейсов в отчёте Anthropic связан с вирусом Чикунгунья — арбовирусом, для которого на сегодняшний день не существует лицензированного лечения. Классификатор безопасности компании перехватил запрос на написание грантовой заявки для исследования, формально обозначенного как «усиление функции» вируса. Проект предусматривал повышение его заразности и способности обходить популяционный иммунитет. Критически важным обстоятельством, на которое указали в Anthropic, стала связь заявленных работ с военным институтом. Именно это сочетание — отсутствие терапевтической альтернативы, направленность на усиление патогенности и институциональная привязка к оборонной структуре — позволило системе классификации распознать запрос как потенциально опасный и заблокировать его.
Птичий грипп и генерация пептидных ядов
Параллельно с кейсом Чикунгунья в Anthropic зафиксировали аналогичные попытки искусственного усиления свойств вируса птичьего гриппа. Методология запросов была схожей: исследователи просили модель помочь в модификации геномных последовательностей с целью повышения вирулентности или устойчивости к существующим средствам защиты. Отдельный пласт угроз составил запрос на создание генеративного конвейера, который оптимизировал характеристики пептидных ядов и повышал их эффективность. По сути, пользователь пытался превратить Claude в инструмент направленного дизайна токсичных молекул, что выходит далеко за рамки легитимной академической работы. Все перечисленные запросы были остановлены на этапе генерации.
Проблема распознавания злонамеренного замысла
Руководитель отдела анализа угроз Anthropic Джейкоб Клейн подчеркнул фундаментальную сложность задачи: в биологических исследованиях граница между легитимной наукой и опасной разработкой размыта до предела. «В реальной жизни злоумышленники не говорят прямо о желании уничтожить мир, поэтому ситуация требует глубокого анализа», — отметил он. Разработка новой вакцины по методологии почти не отличается от модификации опасного патогена: в обоих случаях работа ведётся с геномными последовательностями, используются одни и те же вычислительные инструменты, а формулировки грантовых заявок намеренно обтекаемы. Именно поэтому, по словам Клейна, Anthropic решила действовать максимально осторожно и блокировать любые подозрительные процессы, даже если окончательная квалификация намерений исследователя остаётся неочевидной.
Внешняя оценка: от «тревожных примеров» до геополитического контекста
Старший научный сотрудник Совета по стратегическим рискам Эндрю Вебер назвал выводы отчёта «тревожными примерами того, как поддерживаемые отдельными государствами разработчики биологического оружия пытаются использовать передовые возможности ИИ». Эта оценка вводит в дискуссию геополитический контекст: речь идёт не о единичных «скриптерских» экспериментах, а о системных попытках со стороны государственных или квазигосударственных структур. В ряде публикаций, пересказывающих отчёт, подчёркивается, что среди запросивших доступ к опасным функциям модели были лица, связанные с государствами, находящимися в состоянии стратегического противостояния с США. При этом Anthropic намеренно воздержалась от раскрытия имён учёных и названий лабораторий, объясняя это тем, что речь идёт о действующих исследователях без прямых доказательств преступного намерения, а публичная огласка могла бы нанести им непропорциональный вред.
Противоречивые данные
В отчёте и его пересказах присутствует определённая нестыковка в квалификации зафиксированных инцидентов. С одной стороны, Anthropic использует формулировку «реальные кейсы использования» модели для опасных разработок, что может интерпретироваться как факт успешного получения вредоносных результатов. С другой стороны, компания прямо указывает, что «подозрительные запросы удалось заблокировать», а BBC в своём пересказе оперирует термином «попытки». Таким образом, для читателя остаётся не до конца ясным, какие именно из описанных сценариев — генерация текста гранта по Чикунгунье, оптимизация пептидных ядов, модификация птичьего гриппа — были полностью пресечены на этапе промпта, а какие могли частично реализоваться до срабатывания классификатора. Кроме того, оценка Эндрю Вебера о «государственно-поддерживаемых разработчиках биологического оружия» не подтверждена публичными доказательствами со стороны Anthropic, которая, напротив, подчёркивает отсутствие прямых доказательств преступного намерения у конкретных лиц. Это создаёт разрыв между публичной риторикой экспертов и фактической доказательной базой отчёта.
Усиление защитных механизмов и перспективы
Собранные данные Anthropic уже использует для дальнейшего усовершенствования систем защиты моделей: дорабатываются классификаторы, распознающие биологически опасные запросы, расширяются чёрные списки формулировок и добавляются новые эвристики для выявления обходных промптов. Компания подчёркивает, что текущая архитектура Claude включает многоуровневую фильтрацию, однако каждый новый кейс демонстрирует, что атакующие адаптируются быстрее, чем обновляются защитные правила. Эксперты указывают, что в условиях, когда доступ к передовым LLM-моделям становится всё более массовым, вопрос о балансе между открытостью научных инструментов и предотвращением их применения в целях создания оружия выходит на первый план в дискуссии о регулировании искусственного интеллекта на международном уровне.