От невидимого водяного знака Claude к скрытию информации в эпоху GenAI: как гарантировать безвредность внедрения водяного знака?
11 августа 2026 года компания Anthropic объявила о внедрении невидимой для человека, но читаемой машиной цифровой водяной метки во все тексты, генерируемые новыми моделями Claude, начиная с 2 августа. Эта мера, охватывающая веб-интерфейс, API и Claude Code, является ответом на растущую глобальную потребность в идентификации контента, созданного ИИ, как отмечено в докладе Всемирного экономического форума и прогнозах Кевина Келли.
Ключевой задачей стало обеспечение «доказуемо нулевого влияния» на качество генерируемого текста. Теоретической основой для этого послужила «доказуемо безопасная стеганография», которая требует математического доказательства неотличимости данных со скрытым сообщением от обычных данных. С появлением генеративных ИИ-моделей, которые изучают и точно воспроизводят распределение данных, эта теория получила практическое применение.
Начиная с 2018 года, исследования, в первую очередь командой из Китайского университета науки и технологий (USTC), привели к созданию генеративных стего-систем с доказуемой безопасностью. Дальнейшее развитие преодолело первоначальные ограничения, такие как необходимость общего секретного ключа («симметричная схема») и зависимость от точной копии модели для извлечения данных («белый ящик»). Были разработаны схемы с открытым ключом, системы с извлечением без доступа к модели («чёрный ящик») и гибридные «серо-ящичные» подходы, а также решена проблема неоднозначности токенизации.
Эти принципы легли в основу «доказуемо无损ных» водяных знаков для генеративного ИИ. Если стеганография гарантирует неотличимость распределения, то водяной знак, требующий меньшего объёма скрытых данных, может использовать этот ресурс для повышения устойчивости к удалению. Подобные системы уже применяются в таких моделях, как Spark. Параллельно ведутся международные исследования в этой области (например, «Unbiased Watermark»).
Технология распространяется и на другие модальности. Для изображений метод Gaussian Shading (CVPR 2024) и его последующие версии позволяют внедрять невидимые водяные знаки, не влияя на процесс диффузионной генерации. Кроме того, были предложены методы для встраивания доказуемо безопасных водяных знаков в сами модели ИИ, не ухудшающие их производительность.
Таким образом, область информационного скрытия данных совершила переход от эмпирических методов к системам с математически доказанной безопасностью и нулевым влиянием на качество. Это создаёт техническую основу для атрибуции контента ИИ. Будущее развитие будет определяться балансом между совершенствованием устойчивых водяных знаков и методами их удаления, где условием для обеих сторон остаётся сохранение высокого качества итогового контента.
marsbit08/17 13:08