---
title: "Обхід фільтрів ChatGPT: як команда Mindgard змусила ШІ генерувати заборонений контент"
description: "Британський стартап Mindgard знайшов спосіб обходу фільтрів ChatGPT, змусивши ШІ генерувати сцени насильства без прямих вказівок. Попри обіцянки OpenAI виправити вразливість, дослідники змогли зламати захист повторно. 🔓🤖"
date: 2026-07-06T09:22:00.000Z
lang: uk
url: https://xab.info/uk/posts/obhid-filtriv-chatgpt-yak-komanda-mindgard-zmusyla-shi-generuvaty-zaboronenyi-kontent
tags: []
publisher: "XAB.info"
---

# Обхід фільтрів ChatGPT: як команда Mindgard змусила ШІ генерувати заборонений контент

![Роботизована рука взаємодіє з цифровим інтерфейсом, символізуючи обхід фільтрів безпеки ШІ](https://xab.info/media/2026/07/06/obhod-filtrov-chatgpt-kak-komanda-mindgard-zastavila-ii-generirovat-zapreshchennyj-kontent/obhod-filtrov-chatgpt-kak-komanda-mindgard-zastavila-ii-generirovat-zapreshchennyj-kontent-1.webp)

Британський стартап Mindgard виявив вразливість у системі захисту ChatGPT, яка дозволяє повністю обходити базові інструкції безпеки. Спеціалісти змогли змусити модель OpenAI генерувати чутливий контент, використовуючи метод, що імітує роботу з редагуванням файлів.

### Механіка обходу захисту

Суть виявленого методу полягає у використанні специфічної текстової команди. Користувач звертається до ChatGPT з проханням відновити прикріплене фото, але насправді не завантажує зображення у діалогове вікно. Після цього слідує команда на генерацію нового зображення.

За словами засновника Mindgard, професора комп'ютерних наук Ланкастерського університету Пітера Гаррагана, ця інструкція виглядає для алгоритмів штучного інтелекту абсолютно безпечною. Однак у результаті модель вимикає фільтри модерації та видає заборонений контент.

### Автономна генерація насильства

Особливістю інциденту стало те, що дослідники не вказували конкретних деталей чи сюжетів у своїх запитах. Штучний інтелект самостійно сгенерував сцени із зображенням тілесних ушкоджень та дій, пов'язаних із насильством. Алгоритм також самостійно дав назви створеним файлам.

Раніше спеціалісти Mindgard вже доводили можливість обходу фільтрів для створення реалістичних оголених дипфейків конкретних людей без їхньої згоди.

### Реакція OpenAI та повторний хак

Дослідники передали дані про вразливість розробникам з OpenAI. Спочатку стартап отримав лише автоматичну відповідь системи підтримки. Заходи щодо усунення проблеми були прийняті лише після того, як Mindgard звернувся до журналістів BBC.

У заяві OpenAI для ЗМІ зазначено, що компанія проаналізувала зафіксовану тенденцію та впровадила додаткові захисні інструменти проти цього типу запитів. Також розробники відмітили наявність кількох рівнів модерації для запобігання порушенням політики використання платформи.

Попри оновлення системи, представники Mindgard заявили, що їм вдалося повторно обійти захист, внісши мінімальні зміни в текст інструкції.

### Ризики навчання нейромереж

Спеціалісти з безпеки відзначають, що згенеровані штучним інтелектом образи базуються на масивах реальних фотографій із мережі. Це свідчить про серйозні ризики використання нефільтрованих баз даних для навчання нейромереж.