Коротко
Исследование на arXiv показывает, что watermarking, безупречный на общих задачах, вызывает галлюцинации терминов и искажения в клинических текстах. Стандартные метрики систематически скрывают эти провалы.
Водяные знаки для LLM продаются как решение для трассировки сгенерированного контента. Но первое системное исследование их влияния на медицинские тексты показывает: то, что выглядит безопасно на общих бенчмарках, может тихо разрушать клиническую семантику.
Авторы прогнали 5 схем watermarking через 11 LLM и 7 VLM на задачах одно- и мультимодального клинического рассуждения. Результаты — несколько режимов отказа, которые стандартные метрики не ловят: лексическая порча текста, галлюцинации медицинской терминологии и усиление ошибок атрибуции или пропусков находок на изображениях.
Ключевой конфликт не в том, что водяные знаки ухудшают качество — это ожидаемо. Дело в том, как именно они ухудшают его в специфичных доменах. На уровне токена медицинский текст не прощает мелких возмущений: замена одного термина меняет смысл диагноза. Aggregate-метрики, заточенные под общие тексты, усредняют эти провалы до статистического шума.
Чтобы это показать, авторы построили пайплайн аудита с валидацией экспертами — врачами. Он проверяет качество клинического рассуждения, терминологическую точность и индуцированные галлюцинации отдельно. Именно этот домен-специфичный разбор и выявляет то, что прячут стандартные бенчмарки.
Практический вывод жёстче, чем кажется. Если вы деплоите водяной знак в продакшне для высокостейковых задач — медицина, право, финансы, — общие бенчмарки не дают вам гарантий безопасности. Нужна домен-специфичная оценка с экспертной валидацией. Без неё вы не знаете, какие именно клинически значимые ошибки водяной знак вносит в ваш текст.
Следующий вопрос, который стоит задать разработчикам схем watermarking: можно ли сделать водяной знак, который сохраняет семантику в доменах с высокой ценой каждого токена? Пока ответа нет.
Источник: cs.AI updates on arXiv.org