Сучасні соціальні мережі перетворилися на один із найбільших джерел даних для навчання генеративного штучного інтелекту. Пости, фотографії, коментарі, переписки та навіть взаємодії з ботами за замовчуванням потрапляють у навчальні вибірки великих технологічних компаній, а можливість повністю відмовитися від такої обробки доступна далеко не всім користувачам і не в усіх регіонах. Редакція XAB.info зі посиланням на матеріал РБК-Україна та Lifehacker розібралася, які саме дані використовуються, де в налаштуваннях можна вимкнути їх передачу і чому, на думку аналітиків, найнадійнішим захистом досі залишаються приватні акаунти або їхнє повне видалення.
Як соцмережі використовують ваші дані для навчання ШІ
Компанія Meta залучає до навчання власних моделей повідомлення, фотографії, коментарі та інші форми взаємодії користувачів. Платформа професійного нетворкінгу LinkedIn за замовчуванням використовує повідомлення, коментарі, дані профілів та резюме. Батьківська компанія TikTok — ByteDance — також залучає опублікований контент для тренування алгоритмів. Google, у свою чергу, використовує завантажені на YouTube відео для навчання моделей генерації відео. Таким чином, практично кожен великий сервіс тією чи іншою мірою будує свої ШІ-моделі на контенті користувачів, навіть якщо користувач про це не думає.
Де можна вимкнути навчання ШІ на ваших даних
У більшості платформ існує окремий перемикач у налаштуваннях конфіденційності. У LinkedIn шлях виглядає так: «Налаштування та конфіденційність» → «Конфіденційність даних» → «Дані для покращення генеративного ШІ», де потрібно вимкнути відповідний перемикач. У X вимкнути передачу даних можна через «Налаштування» → «Конфіденційність і безпека» → «Обмін даними та персоналізація» → «Grok та сторонні партнери». На YouTube авторам контенту в «Творчій студії» доступний розділ «Налаштування» → «Канал» → «Розширені налаштування», однак він дозволяє заборонити лише навчання моделей сторонніх компаній. Для TikTok механізм відмови інший: необхідно заповнити спеціальну форму заперечення через порушення конфіденційності на сторінці підтримки.
Суперечливі дані
Тут є суттєві розбіжності між офіційними заявами платформ і фактичним потоком даних. Так, X офіційно заявляє, що не тренує власні моделі на постах користувачів, однак через відкритість децентралізованого протоколу будь-які публічні дані можуть парситися сторонніми розробниками, а публічні повідомлення та взаємодії з ботом Grok фактично використовуються для навчання моделей xAI. Виходить, що формальна відмова платформи від навчання не тотожна захисту даних користувача. Аналогічна застереження стосується Meta: опція повної відмови від використання даних для ШІ діє переважно для мешканців ЄС через вимоги європейського законодавства, тоді як користувачам з інших регіонів доступна лише подання скарги у разі виявлення своїх персональних даних у відповідях нейронної мережі. Тобто «червона кнопка» відмови існує не для всіх і не всюди.
Що рекомендують аналітики
Експерти підкреслюють, що через модель за замовчуванням «збираємо автоматично» налаштування окремих перемикачів не дає повної гарантії. Найнадійнішими способами захисту контенту аналітики називають переведення акаунтів у приватний режим або їхнє повне видалення, оскільки більшість сервісів збирають дані автоматично. Для користувачів, яким принципово важлива конфіденційність, це означає, що питання захисту від ШІ-навчання вирішується не одним налаштуванням, а комплексом рішень: від обмеження публічності до контролю над тим, які саме сервіси отримують доступ до контенту.