Компанія Anthropic, розробник однієї з провідних мовних моделей Claude, офіційно розкрила деталі впровадження системи невидимого маркування тексту. Ця технологія має допомогти користувачам та регуляторам розрізняти контент, згенерований штучним інтелектом, від тексту, написаного людиною. Це рішення стало відповіддю на посилившіся вимоги Європейського Союзу щодо регулювання ШІ, а також на глобальний запит на прозорість цифрового контенту.

Технологія SynthID: прихований математичний патерн

В основі нової системи лежить алгоритм SynthID-Text, спочатку розроблений командою Google DeepMind. Механізм роботи водяного знака не потребує додавання спеціальних символів, прихованих токенів або зміни візуального оформлення тексту. Натомість модель Claude використовує спеціальний ключ генерації випадкових чисел для вибору між синонімічними варіантами слів. Наприклад, при описі погоди модель може обрати слово «хмарно» чи «похмуро» не лише на основі контексту, а й відповідно до математичного патерну, який формує унікальний підпис.

Безпека даних та конфіденційність

Розробники Anthropic наголошують, що впроваджена технологія не впливає на швидкість генерації відповідей і не збільшує вартість використання сервісу. Важливим аспектом є конфіденційність: прихований патерн не містить персональних даних користувачів, інформації про організації чи історії конкретних діалогів. Це дозволяє маркувати контент, не порушуючи приватності користувачів і не створюючи вразливостей для витоку інформації.

Обмеження та межі застосування

Ефективність водяного знака залежить від природи тексту. У ситуаціях, що вимагають суворої точності, таких як фактичні дані чи програмний код, алгоритм майже не застосовується, оскільки модель не має свободи вибору синонімів. Винятком можуть бути лише довільні назви змінних чи коментарі в коді. Крім того, незначне редагування тексту людиною не видалить водяний знак повністю, однак повний перепис з заміною кожного слова знищить маркування.

Інструменти верифікації та стандарти C2PA

Для перевірки наявності водяного знака компанія планує запустити спеціальний API. Цей інструмент визначатиме ймовірність участі Claude у створенні тексту, але не зможе ідентифікувати конкретного автора чи підтвердити, що текст написано повністю людиною. Для мультимедійного контенту, включаючи зображення у форматах .png, .jpg та .svg, використовуватимуться криптографічні метадані стандарту C2PA, що забезпечить цілісність файлів без зміни їхнього вмісту.