Компания Anthropic, разработчик одной из ведущих языковых моделей Claude, официально раскрыла детали внедрения системы невидимой маркировки текста. Данная технология призвана помочь пользователям и регуляторам отличать контент, сгенерированный искусственным интеллектом, от текста, написанного человеком. Решение стало ответом на ужесточающиеся требования Европейского Союза в области регулирования ИИ, а также на глобальный запрос на прозрачность цифрового контента.

Технология SynthID: скрытый математический паттерн

В основе новой системы лежит алгоритм SynthID-Text, изначально разработанный командой Google DeepMind. Механизм работы водяного знака не требует добавления специальных символов, скрытых токенов или изменения визуального оформления текста. Вместо этого модель Claude использует специальный ключ генерации случайных чисел для выбора между синонимическими вариантами слов. Например, при описании погоды модель может выбрать слово «облачно» или «мрачно» не только на основе контекста, но и в соответствии с математическим паттерном, который формирует уникальную подпись.

Безопасность данных и конфиденциальность

Разработчики Anthropic подчеркивают, что внедренная технология не влияет на скорость генерации ответов и не увеличивает стоимость использования сервиса. Важным аспектом является конфиденциальность: скрытый паттерн не содержит персональных данных пользователей, информации об организациях или истории конкретных диалогов. Это позволяет маркировать контент, не нарушая приватности пользователей и не создавая уязвимостей для утечек информации.

Ограничения и границы применения

Эффективность водяного знака зависит от природы текста. В ситуациях, требующих строгой точности, таких как фактические данные или программный код, алгоритм почти не применяется, так как модель не имеет свободы выбора синонимов. Исключением могут стать только произвольные названия переменных или комментарии в коде. Кроме того, незначительное редактирование текста человеком не удалит водяной знак полностью, однако полная переписка с заменой каждого слова уничтожает маркировку.

Инструменты верификации и стандарты C2PA

Для проверки наличия водяного знака компания планирует запустить специальный API. Этот инструмент будет определять вероятность участия Claude в создании текста, но не сможет идентифицировать конкретного автора или подтвердить, что текст написан полностью человеком. Для мультимедийного контента, включая изображения в форматах .png, .jpg и .svg, будут использоваться криптографические метаданные стандарта C2PA, что обеспечит целостность файлов без изменения их содержимого.