---
title: "Системный провал безопасности: Anthropic признала, что 133 млн диалогов проходили без защиты от биологического оружия"
description: "🚨 Anthropic признала масштабный сбой безопасности: 11 месяцев без защиты от биологического оружия. 133 млн диалогов прошли без фильтров, а модель Mythos 5 критиковала собственный отчёт. #AI #Безопасность #Anthropic"
date: 2026-08-16T20:51:55.000Z
lang: ru
url: https://xab.info/posts/anthropic-sistemnyy-proval-bezopasnosti-133-mln-dialogov-bez-zashchity
tags: [anthropic, ai-safety, biological-weapon, cybersecurity, risk-report]
publisher: "XAB.info"
---

# Системный провал безопасности: Anthropic признала, что 133 млн диалогов проходили без защиты от биологического оружия

![Сотрудник центра мониторинга анализирует данные на множестве экранов, иллюстрируя масштаб утечки 133 млн диалогов без защиты от биологического оружия в системе Anthropic](https://xab.info/media/2026/08/17/anthropic-sistemnyy-proval-bezopasnosti-133-mln-dialogov-bez-zashchity/anthropic-sistemnyy-proval-bezopasnosti-133-mln-dialogov-bez-zashchity-1.webp)

## 🎯 Key Points

- 11 месяцев без защиты от биологического оружия на платформах Anthropic
- 133 миллиона диалогов прошли без фильтров безопасности
- Модель Mythos 5 критиковала собственный отчёт о рисках
- Смягчение стандартов безопасности для биологического оружия

14 августа 2026 года компания Anthropic опубликовала новый отчёт о рисках (Risk Report), который, по мнению экспертов, стал одним из самых тревожных документов в истории развития искусственного интеллекта. Документ, охватывающий период до 15 июля 2026 года, содержит признание в масштабном системном сбое: в течение 11 месяцев критические механизмы безопасности, призванные блокировать создание биологического оружия, были полностью отключены на ключевых платформах компании.

### 11 месяцев без защиты: масштаб инцидента

Согласно данным отчёта, с мая 2025 года по апрель 2026 года классификаторы, отвечающие за фильтрацию запросов, связанных с биологическим оружием, не функционировали на платформах сбора человеческой обратной связи (Human Feedback). Это не просто технический баг, а системная уязвимость, через которую прошло около 50 000 специалистов, привлеченных через внешних поставщиков, и 133 миллиона диалогов. В апреле 2026 года компания получила сигнал о том, что несколько подрядчиков обнаружили уязвимость и получили API-ключ к мощным моделям, включая Mythos Preview. В течение примерно двух недель модель работала без био-классификаторов, что создало теоретическую возможность для генерации опасных инструкций.

### Механизм сбоя: «Тихий» флаг и отсутствие логирования

В разделе 4 отчёта подробно описан механизм сбоя. Внутренний флаг, предназначенный исключительно для использования сотрудниками Anthropic, отключал не только блокирующее поведение классификаторов, но и логирование трафика. Это означало, что запросы, прошедшие под этим флагом, не записывались и не попадали ни в одну систему мониторинга безопасности. Единственным способом обнаружить проблему было бы ручное перебирание сырых диалогов, что в условиях миллионов запросов практически невозможно. После обнаружения проблемы Anthropic прогнала модель Claude Sonnet 5 по всем диалогам затронутого периода и выявила 1197 подозрительных диалогов, из которых 757 пришлись на собственные команды компании.

### Противоречивые данные

В отчёте присутствуют существенные расхождения в оценке рисков и полноте раскрытия информации. С одной стороны, Anthropic утверждает, что явного злонамеренного использования уязвимости не найдено, а веса моделей и данные клиентов не скомпрометированы. С другой стороны, компания признает, что «это открытие заставляет нас полагать, что вероятность других, неизвестных нам проблем повышена». Более того, модель Mythos 5, которой был предоставлен доступ к внутренним документам для оценки честности отчёта, указала на три проблемы: одна секция отчёта оказалась «более успокаивающей, чем позволяет полная запись», механизм исключения данных отказывал многократно, а самый информативный инцидент был полностью исключен из публичной версии. Anthropic назвала критику справедливой, но это лишь подчеркивает, что полная картина инцидента может быть скрыта.

### Смягчение стандартов безопасности

Параллельно с признанием сбоя, компания изменила подход к безопасности. Anthropic смягчила порог срабатывания фильтров для биологического оружия: раньше они покрывали модели, которые «значительно помогают злоумышленникам», теперь — только те, что «функционально заменяют дефицитную человеческую экспертизу». Это изменение, возможно, направлено на снижение ложных срабатываний, но в контексте недавнего инцидента вызывает вопросы о приоритетах безопасности. Кроме того, февральский Risk Report, опубликованный, когда уязвимость еще существовала, не рассматривал платформы обратной связи для оценки масштаба риска. Теперь, задним числом, Anthropic повысила оценку вреда от несоответствующего поведения моделей в критических сценариях с «очень низкой» до «низкой».

### Выводы и последствия

Публикация отчёта и признание в системном провале безопасности ставят под сомнение способность Anthropic контролировать развитие своих моделей. Несмотря на то, что компания утверждает, что явного злонамеренного использования не было, сам факт того, что 133 миллиона диалогов проходили без защиты от биологического оружия, является тревожным сигналом для всей отрасли. Это событие может стать поворотным моментом в регулировании ИИ и заставить регуляторов ужесточить требования к безопасности моделей.

## ❓ FAQ

### Q: Что произошло с Anthropic?
**A:** Anthropic признала, что в течение 11 месяцев классификаторы, блокирующие создание биологического оружия, не работали на платформах обратной связи.

### Q: Сколько диалогов прошло без защиты?
**A:** Около 133 миллионов диалогов прошло без защиты от биологического оружия.

### Q: Было ли злонамеренное использование уязвимости?
**A:** Anthropic утверждает, что явного злонамеренного использования не найдено, но признает, что вероятность других проблем повышена.

### Q: Что сказала модель Mythos 5 об отчёте?
**A:** Модель назвала отчёт «в основном откровенным», но указала на три проблемы, включая исключение самого информативного инцидента.