Компанія OpenAI офіційно оголосила про початок виконання нових жорстких вимог Європейського Союзу щодо прозорості систем штучного інтелекту. Розробник популярного чат-бота ChatGPT впроваджує спеціальну технологію невидимого маркування для текстового контенту та програмного коду, створюваного користувачами на території європейських держав. Цей крок став відповіддю на набуття чинності ключовими положеннями Регламенту ЄС про штучний інтелект, який вимагає від технологічних гігантів забезпечувати машинно-зчитувану ідентифікацію згенерованих матеріалів задля уникнення масштабних штрафних санкцій.
Технологія textGrain та принципи роботи водяних знаків
Для реалізації нових вимог інженери OpenAI задіяли власну розробку під назвою textGrain. Ця система інтегрує непомітний статистичний сигнал безпосередньо в алгоритм вибору слів мовною моделлю, завдяки чому візуальне сприйняття тексту чи програмного коду абсолютно не змінюється для людини. За даними розробників, на великих текстових фрагментах обсягом близько 400 токенів ефективність розпізнавання досягає 95 відсотків. Водночас для коротших повідомлень, що містять до 200 токенів, цей показник знижується приблизно до 80 відсотків, що накладає певні обмеження на експрес-аналіз коротких реплік.
Протиріччя в даних та стійкість міток
У експертному середовищі та профільних технічних виданнях активно обговорюються реальні технічні обмеження впроваджуваних водяних знаків, причому в різних джерелах наводяться дещо відмінні оцінки їхньої стійкості. Так, згідно з офіційною базовою документацією OpenAI, сильне перефразування або заміна чверті слів синонімами здатна суттєво послабити водяний знак, знижуючи точність детекції до 17 відсотків. Водночас незалежні технологічні портали, зокрема видання yellow.com, вказують, що навітьrelatively легке ручне редагування згенерованого контенту може знижувати точність розпізнавання до 66 відсотків. Крім того, серйозним викликом залишаються складні домени на кшталт математичних обчислень, де жорстка логіка обмежує варіативність вибору символів.
Правові рамки, строки та гігантські штрафи
Нововведення реалізуються у суворій відповідності до статті 50 Регламенту ЄС про регулювання штучного інтелекту. Ця норма зобов'язує всі системи генеративного характеру маркувати контент, включаючи текст, фото, аудіо та відео, спеціальною міткою "AI-Generated", особливо якщо йдеться про потенційні дипфейки чи новинні відомості. Нові розробники зобов'язані дотримуватися правил з серпня, тоді як діючі гравці ринку отримали адаптаційний період до 2 грудня. За порушення цих вимог передбачено безпрецедентні фінансові санкції: штрафи можуть досягати 15 мільйонів євро або складати до 3 відсотків від річного світового обороту компанії, що підкреслює серйозність намірів європейського регулятора.