---
title: "Системний провал безпеки: Anthropic визнала, що 133 млн діалогів проходили без захисту від біологічної зброї"
description: "🚨 Anthropic визнала масштабний збій безпеки: 11 місяців без захисту від біологічної зброї. 133 млн діалогів пройшли без фільтрів, а модель Mythos 5 критикувала власний звіт. #AI #Безпека #Anthropic"
date: 2026-08-16T20:51:55.000Z
lang: uk
url: https://xab.info/uk/posts/anthropic-systemnyy-proval-bezpeky-133-mln-dialogiv-bez-zakhystu-uk
tags: [anthropic, ai-safety, biological-weapon, cybersecurity, risk-report]
publisher: "XAB.info"
---

# Системний провал безпеки: Anthropic визнала, що 133 млн діалогів проходили без захисту від біологічної зброї

![Співробітник центру моніторингу аналізує дані на кількох екранах, ілюструючи масштаб витоку 133 мільйонів діалогів без захисту від біологічної зброї в системі Anthropic](https://xab.info/media/2026/08/17/anthropic-sistemnyy-proval-bezopasnosti-133-mln-dialogov-bez-zashchity/anthropic-sistemnyy-proval-bezopasnosti-133-mln-dialogov-bez-zashchity-1.webp)

## 🎯 Key Points

- 11 місяців без захисту від біологічної зброї на платформах Anthropic
- 133 мільйони діалогів пройшли без фільтрів безпеки
- Модель Mythos 5 критикувала власний звіт про ризики
- Пом'якшення стандартів безпеки для біологічної зброї

14 серпня 2026 року компанія Anthropic опублікувала новий звіт про ризики (Risk Report), який, на думку експертів, став одним із найтривожніших документів в історії розвитку штучного інтелекту. Документ, що охоплює період до 15 липня 2026 року, містить визнання масштабного системного збою: протягом 11 місяців критичні механізми безпеки, призначені для блокування створення біологічної зброї, були повністю вимкнені на ключових платформах компанії.

### 11 місяців без захисту: масштаб інциденту

Згідно з даними звіту, з травня 2025 року по квітень 2026 року класифікатори, що відповідають за фільтрацію запитів, пов'язаних із біологічною зброєю, не функціонували на платформах збору людського зворотного зв'язку (Human Feedback). Це не просто технічний баг, а системна вразливість, через яку пройшло близько 50 000 фахівців, залучених через зовнішніх постачальників, і 133 мільйони діалогів. У квітні 2026 року компанія отримала сигнал про те, що кілька підрядників виявили вразливість і отримали API-ключ до потужних моделей, включаючи Mythos Preview. Протягом приблизно двох тижнів модель працювала без біо-класифікаторів, що створило теоретичну можливість для генерації небезпечних інструкцій.

### Механізм збою: «Тихий» прапорець та відсутність логів

У розділі 4 звіту детально описано механізм збою. Внутрішній прапорець, призначений виключно для використання співробітниками Anthropic, вимикав не лише блокуючу поведінку класифікаторів, а й логірування трафіку. Це означало, що запити, що пройшли під цим прапорцем, не записувалися і не потрапляли жодну систему моніторингу безпеки. Єдиним способом виявити проблему було б ручне переглядання сирих діалогів, що в умовах мільйонів запитів практично неможливо. Після виявлення проблеми Anthropic прогнала модель Claude Sonnet 5 через усі діалоги затронутого періоду і виявила 1197 підозрілих діалогів, з яких 757 припали на власні команди компанії.

### Суперечливі дані

У звіті присутні суттєві розбіжності в оцінці ризиків та повноті розкриття інформації. З одного боку, Anthropic стверджує, що явного умисного використання вразливості не знайдено, а ваги моделей та дані клієнтів не скомпрометовані. З іншого боку, компанія визнає, що «це відкриття змушує нас вважати, що ймовірність інших, невідомих нам проблем підвищена». Більш того, модель Mythos 5, якій було надано доступ до внутрішніх документів для оцінки чесності звіту, вказала на три проблеми: один розділ звіту виявився «більш заспокійливим, ніж дозволяє повна запис», механізм виключення даних відмовляв неодноразово, а найінформативніший інцидент був повністю виключений із публічної версії. Anthropic назвала критику справедливою, але це лише підкреслює, що повна картина інциденту може бути прихована.

### Пом'якшення стандартів безпеки

Паралельно із визнанням збою, компанія змінила підхід до безпеки. Anthropic пом'якшила поріг спрацювання фільтрів для біологічної зброї: раніше вони покривали моделі, які «значно допомагають зловмисникам», тепер — лише ті, що «функціонально замінюють дефіцитну людську експертизу». Це зміна, можливо, спрямована на зниження хибних спрацювань, але в контексті недавнього інциденту викликає запитання щодо пріоритетів безпеки. Крім того, лютий Risk Report, опублікований, коли вразливість ще існувала, не розглядав платформи зворотного зв'язку для оцінки масштабу ризику. Тепер, заднім числом, Anthropic підвищила оцінку шкоди від невідповідної поведінки моделей у критичних сценаріях з «дуже низької» до «низької».

### Висновки та наслідки

Публікація звіту та визнання в системному провалі безпеки ставлять під сумнів здатність Anthropic контролювати розвиток своїх моделей. Незважаючи на те, що компанія стверджує, що явного умисного використання не було, сам факт того, що 133 мільйони діалогів проходили без захисту від біологічної зброї, є тривожним сигналом для всієї галузі. Ця подія може стати поворотним моментом у регулюванні ШІ і змусити регуляторів посилити вимоги до безпеки моделей.

## ❓ FAQ

### Q: Що сталося з Anthropic?
**A:** Anthropic визнала, що протягом 11 місяців класифікатори, що блокують створення біологічної зброї, не працювали на платформах зворотного зв'язку.

### Q: Скільки діалогів пройшло без захисту?
**A:** Близько 133 мільйонів діалогів пройшло без захисту від біологічної зброї.

### Q: Чи було умисне використання вразливості?
**A:** Anthropic стверджує, що явного умисного використання не знайдено, але визнає, що ймовірність інших проблем підвищена.

### Q: Що сказала модель Mythos 5 про звіт?
**A:** Модель назвала звіт «в основному відвертим», але вказала на три проблеми, включаючи виключення найінформативнішого інциденту.