Компании, разрабатывающие искусственный интеллект, научились оставлять скрытые водяные знаки в текстах, которые генерируют их модели. Как сообщает 24 Канал, такие маркировки уже внедряют, в частности, в моделях Claude от Anthropic, выпущенных после 2 августа, но пользователи не видят их при обычном чтении.
Водяные знаки в текстах работают иначе, чем в изображениях: если для картинок используют логотипы или метаданные, то в тексте скрытый код вплетается непосредственно в последовательность слов. Современные языковые модели, такие как Claude, составляют предложения постепенно, выбирая каждый следующий токен (слово, часть слова или знак препинания) на основе математических вероятностей. На этом этапе разработчики могут немного изменить вероятность появления определённых слов, чтобы создать уникальный узор, который не влияет на смысл, но остаётся невидимым для читателя.
Как объясняют специалисты, отдельное предложение не позволяет обнаружить водяной знак, но если проанализировать большой текст, становится заметна характерная математическая последовательность. Собственный детектор Google под названием SynthID способен быстро распознать такие скрытые маркировки в текстах, созданных ИИ.
Однако технология имеет и свои ограничения. Водяной знак нельзя надёжно внедрить в коротких предложениях, а глубокое редактирование человеком или перефразирование другим искусственным интеллектом полностью разрушает скрытый узор. При этом клишированные фразы, которые часто использует ИИ, не являются признаком водяного знака — это лишь стилистическая особенность, а не техническая маркировка.
«Даже полностью естественный и живой текст может содержать скрытую маркировку», — подчёркивают эксперты, чьи слова приводит 24 Канал.

