Водяной знак в тексте оказался не просто невидимой биркой «это сделал ИИ». В тестах SynthID-Text он иногда сдвигал поведение модели: вредный запрос, который без метки получал отказ, с включённым watermarking мог пройти дальше.
Механика вроде бы скучная: модель выбирает следующее слово, а SynthID-Text подмешивает секретный ключ в этот выбор. Читатель почти не видит разницы — условно, вместо одного близкого слова вылезает другое. Зато владелец ключа потом может проверить, похож ли текст на выпущенный этой системой. Такая пломба на коробке, только коробка из слов.
Подвох в том, что у LLM следующий токен — это уже не всегда «просто слово». Если модель работает как агент, этот выбор может решить, какой инструмент вызвать и какие аргументы туда передать. Поэтому Andrea Siposova из Lasso Security проверяла не открытки про котиков, а вредные запросы и prompt injection. В эксперименте были шесть open-weight моделей, watermarking включали через Hugging Face SynthIDTextWatermarkLogitsProcessor. Сдвиг сильнее проявлялся именно под атакой: где-то отказ держался хуже, где-то менялись tool calls, а разные секретные ключи давали разный эффект.
История цепляет Anthropic: будущие модели Claude должны использовать SynthID-Text, метод Google с открытой реализацией. Но важная граница вот где: Claude в этом исследовании не тестировали. И закрытую реализацию Anthropic тоже не тестировали. Проверяли конкретную открытую схему на других моделях, при контролируемых настройках.
Так что вывод не «водяные знаки опасны, все разбежались». Вывод проще и неприятнее: watermarking нельзя прикрутить последним винтиком и считать, что безопасность осталась прежней. Если модель умеет ходить в почту, файлы, внутренние API или другие инструменты, её надо заново гонять через red-team уже с включённой меткой. Иначе получится классика: наклейку «проверено» наклеили, а дверь рядом стала открываться легче.
Второй независимой проверки в сохранённом пакете нет; опора здесь — материал Ars Technica и описанный в нём эксперимент Lasso Security. Поэтому без лишней магии: подтверждён сам эффект sampling drift на протестированных open-weight моделях, а не проблема конкретно в Claude.
