Компанії, що розробляють штучний інтелект, навчилися залишати приховані водяні знаки у текстах, які генерують їхні моделі. Як повідомляє 24 Канал, такі маркування вже впроваджують, зокрема, у моделях Claude від Anthropic, випущених після 2 серпня, але користувачі не бачать їх під час звичайного читання.

Водяні знаки у текстах працюють інакше, ніж у зображеннях: якщо для картинок використовують логотипи чи метадані, то у тексті прихований код вплітається безпосередньо у послідовність слів. Сучасні мовні моделі, як-от Claude, складають речення поступово, обираючи кожен наступний токен (слово, частину слова чи розділовий знак) на основі математичних ймовірностей. На цьому етапі розробники можуть трохи змінити ймовірність появи певних слів, щоб створити унікальний візерунок, який не впливає на зміст, але залишається невидимим для читача.

Як пояснюють фахівці, окреме речення не дозволяє виявити водяний знак, але якщо проаналізувати великий текст, стає помітною характерна математична послідовність. Власний детектор Google під назвою SynthID здатний швидко розпізнати такі приховані маркування у текстах, створених ШІ.

Однак технологія має і свої обмеження. Водяний знак не можна надійно впровадити у коротких реченнях, а глибоке редагування людиною або перефразування іншим штучним інтелектом повністю руйнує прихований візерунок. При цьому клішовані фрази, які часто використовує ШІ, не є ознакою водяного знака — це лише стильова особливість, а не технічне маркування.

«Навіть повністю природний і живий текст може містити приховане маркування», — наголошують експерти, чиї слова наводить 24 Канал.