11 августа 2026 года Anthropic объявила: новые модели Claude, выпущенные с 2 августа, будут напрямую встраивать в генерируемый текст невидимый для человека, но читаемый машиной невидимый водяной знак, позволяющий программно идентифицировать и отслеживать происхождение контента, созданного ИИ, даже после его копирования и распространения.
В официальной документации говорится: «Когда поддерживаемая модель Claude генерирует текст, она напрямую встраивает в него водяной знак, который трудно заметить. Вы его не увидите, и он не изменит семантику, качество ответа Claude, а также не повлияет на его читаемость.»
Этот механизм охватывает веб-версию Claude, API, Claude Code и все линейки продуктов, вступает в силу для пользователей по всему миру и не может быть отключен; генерируемые изображения и другие файлы также будут содержать метаданные цифровой подписи для отслеживания происхождения, соответствующие стандарту C2PA.
Это знаковое мероприятие после того, как Anthropic подписала кодекс поведения о прозрачности статьи 50 «Закона об искусственном интеллекте» Европейского Союза.
«Наложение водяных знаков» на контент, созданный ИИ, превращается из корпоративной инициативы в глобальный консенсус. В июне 2025 года Всемирный экономический форум на Летнем Давосе в Тяньцзине опубликовал «Десять ведущих новых технологий 2025 года», где «генерирующий водяной знак» занял второе место; футуролог Кевин Келли в своей книге «2049: Возможности следующих 10000 дней» предсказал, что эпоха искусственного интеллекта требует «переосмысления реальности» и «добавления на созданные ИИ изображения и видео маркеров, подобных водяным знакам, для определения подлинности».

Рис.1 Летний Давос и предсказание Кевина Келли
Однако «правильно» реализовать водяной знак непросто.
В день объявления Anthropic наибольшие сомнения пользователей вызвал именно вопрос: повлияет ли наложение водяного знака на модель? Снизит ли оно качество генерации?
«Доказуемо безвредное для производительности» стало ключевой задачей исследований в области скрытия информации в эпоху GenAI. Чтобы понять эту задачу, необходимо вернуться к её теоретическим истокам — доказуемо безопасному стеганографированию.
Доказуемо безопасное стеганографирование: двадцатилетнее ожидание генеративных моделей
Стеганография и водяные знаки относятся к скрытию информации. Традиционная стеганография долгое время оставалась на уровне «эмпирической безопасности»: безопасность оценивалась с помощью алгоритмов детектирования стеганографии, без возможности дать математические гарантии. Доказуемо безопасное стеганографирование требует строгого доказательства: данные со скрытым сообщением и обычные данные неразличимы по распределению.
Эта теоретическая линия существует давно.
В 1949 году Шеннон указал на сложность создания теории скрытой связи; в 1998 году Кахин ввёл относительную энтропию, дав определение безопасности в информационно-теоретическом смысле; в 2002 году лауреат премии Тьюринга Мануэль Блум руководил Хоппером и другими в создании вычислительно-безопасной стеганографической структуры, которая в 2004 году развилась в стеганографию с открытым ключом и скрытое согласование ключей.
Однако все конструкции доказуемо безопасной стеганографии зависят от одного строгого условия — возможность точной выборки из распределения носителя. Распределения естественных данных неконтролируемы, поэтому теория на долгие годы заглохла.

Рис.2 Краткая хронология развития доказуемо безопасной стеганографии
В 2018 году произошёл перелом благодаря моделям генеративного ИИ: модель сначала изучает распределение, а затем производит выборку согласно этому распределению, естественным образом предоставляя «явное распределение или идеальный сэмплер».
Команда USTC первой в мире предложила идею генеративной доказуемо безопасной стеганографии, представив две структуры: «чёрный ящик выборки» и «сжатие — обратимая выборка» (IWDW 2018, arXiv 2018), сводя безопасность стеганографии к безопасности алгоритма шифрования — сообщение шифруется в псевдослучайный шифртекст, который управляет генерацией контента, а получатель восстанавливает шифртекст через обратную выборку.
В то время генеративный ИИ ещё не взорвался, и эта идея казалась «опережающей время», с трудом получая признание коллег из академических кругов. По мере быстрого улучшения качества генеративных моделей, таких как синтез речи, соответствующие результаты постепенно были признаны, и Международный семинар по водяным знакам и фоорензике (IWDW) пригласил команду USTC выступить с пленарным докладом на тему «Когда доказуемо безопасная стеганография встречается с генеративными моделями».

Рис.3 Первая статья о генеративной доказуемо безопасной стеганографии
Примерно в 2021 году данные, созданные ИИ, постепенно стали основной формой сетевого контента, и доказуемо безопасная стеганография получила широкое внимание во всём мире: Университет Цинхуа предложил доказуемо безопасную лингвистическую стеганографию на основе группировки выборок (Findings of ACL 2021); Бостонский университет и Университет Джонса Хопкинса предложили криптографически безопасную стеганографию Meteor для реальных распределений (ACM CCS 2021); Оксфордский университет предложил идеально безопасную стеганографию на основе минимальной энтропийной связи (ICLR 2023).
Команда USTC предложила конструкцию Discop на основе «копии распределения» (IEEE S&P 2023), значительно повысив скорость внедрения полезной нагрузки. В том же году журнал Quanta Magazine назвал «идеальное сокрытие секретной информации в генерируемых данных» одним из семи прорывов года в международной компьютерной науке, провозгласив начало «доказуемой» эры в скрытии информации.
От симметричной к асимметричной, от «с ящиком» к «без ящика»
Ранние генеративные доказуемо безопасные стеганографические системы были построены на «симметричных ключах», отправитель и получатель должны были заранее разделить общий ключ и полагались на извлечение с «белым ящиком», что ограничивало сферы применения.
Кроме того, неоднозначность субслов (subwords) могла приводить к неудаче при извлечении. Команда USTC продвинула технический путь к стеганографии с открытым ключом, сценариям «без ящика»/«серого ящика» и устранила неоднозначность субслов, сделав генеративное скрытие практичным.
Стеганография с открытым ключом (IEEE TIFS 2024): Предложена доказуемо безопасная схема стеганографии с открытым ключом, сочетающая криптографию на эллиптических кривых (ECC) с генеративными моделями, а также протокол обмена стеганографическими ключами. Решены проблемы согласования стеганографических ключей и «асимметричного» извлечения скрытой информации.
Стеганография без ящика (IEEE TMM 2026): Традиционные методы зависели от извлечения «с белым ящиком», получатель должен был иметь точно такую же языковую модель, как у отправителя. Команда предложила Disreo, реализовав «извлечение без ящика» через рандомизацию позиций токенов и рекомбинацию выходных вероятностей, позволяя получателю восстанавливать сообщение без доступа к базовой модели, что обеспечивает большее удобство для реального развертывания.
Стеганография с серым ящиком (ACM CCS 2026): Между сценариями с белым и без ящика существует «серый ящик» — ресурсы отправителя и получателя неравны, у получателя может быть возможность запускать только маленькую модель (например, на мобильном устройстве). SpecStega основана на спекулятивной выборке (speculative sampling): общая маленькая модель используется для внедрения и извлечения сообщения, а затем целевая большая модель уточняет вывод, так что итоговый текст со скрытым сообщением соответствует выходному распределению большой модели, сохраняя высокое качество и безопасность, и при этом эффективно декодируется на стороне получателя только с помощью маленькой модели. Скорость полезной нагрузки увеличилась более чем в 20 раз по сравнению с существующими чёрноящичными схемами — предоставив доказуемо безопасной стеганографии третий путь между «с ящиком» и «без ящика».
Решение неоднозначности субслов (IEEE TDSC): Стеганография на основе больших языковых моделей обычно сталкивается с неоднозначностью декодирования токенов (segmentation) — один и тот же текст может быть разбит на разные последовательности субслов, что приводит к сбою извлечения. Команда предложила SyncPool, группируя перед внедрением токены с префиксными отношениями, принципиально устраняя неоднозначность и обеспечивая надежное извлечение в доказуемо безопасной стеганографии.
От стеганографии к водяным знакам: путь «доказуемой безвредности» в индустрию
Большие модели AIGC сначала изучают распределение естественных данных, а затем генерируют текст, изображения, аудио-видео контент путём выборки из этого распределения. Если можно добиться внедрения водяного знака в генерируемый контент без влияния на распределение выборки, это будет означать, что внедрение водяного знака не влияет на качество генерации.
Доказуемо безопасная стеганография теоретически гарантирует неразличимость распределений данных со скрытым сообщением и обычных генерируемых данных, т.е. внедрение информации не изменяет распределение выборки модели — это и есть определение «доказуемо безвредного для качества генерации водяного знака». Водяным знакам не требуется такой большой ёмкости, как стеганографии, поэтому ёмкость можно обменять на робастность.
В текстовой области команда USTC разработала систему доказуемо безвредных для качества генерации водяных знаков, которая работает по принципу «включай и используй», не требует изменения параметров модели, поддерживает одноразрядное робастное распознавание и многоразрядную атрибуцию моделей, уже применяется в платформах, таких как большая модель Spark и безопасная модель GPT, обслуживая 13 000 разработчиков.
Между тем, исследования доказуемо безвредных водяных знаков для генерации текста также быстро развиваются в мире:
В 2024 году команда Университета Мэриленда и др. в статье «Unbiased Watermark for Large Language Models» (ICLR 2024 Spotlight) определили несмещённый водяной знак и дали общую конструкцию;
В том же году Стэнфордский университет предложил робастный несмещённый водяной знак, устойчивый к искажениям (TMLR 2024);
В 2025 году многоканальный несмещённый водяной знак MCmark (ACL 2025) повысил робастность извлечения водяного знака при сохранении строгой несмещённости.
В области изображений команда USTC предложила Gaussian Shading (CVPR 2024), преобразовывая зашифрованный рандомизированный водяной знак в гауссовы латентные переменные, неотличимые от обычной генерации, которые затем через процесс диффузии воздействуют на всё латентное пространство, не требуя обучения, работая по принципу «включай и используй», доказуемо безвредны для производительности;
Gaussian Shading++ и T2SMark (NeurIPS 2025) дополнительно решили проблемы робастности при реальном развёртывании, изменения параметров генерации и разнообразия генерации;
TAG-WM (ICCV 2025) ввёл двойной механизм «водяной знак-шаблон + информационный водяной знак», одновременно реализующий локализацию искажений и подтверждение авторства при условии безвредности;
SemBind (ICML 2026) через семантический маскер связывает водяной знак с семантикой изображения, защищая от атак чёрного ящика на подделку.

Рис.4 Доказуемо безвредный генеративный водяной знак для изображений Gaussian Shading (CVPR 2024)
От водяных знаков для контента к водяным знакам для моделей. Сами модели также являются важными цифровыми активами и требуют надежного подтверждения принадлежности, а водяные знаки для моделей всегда сталкиваются с одним вопросом: повлияет ли это на нормальное использование модели?
Заимствуя конструкцию «доказуемо необнаруживаемого бэкдора», предложенную лауреатом премии Тьюринга Шафи Голдвассер и др. в FOCS 2022, команда USTC предложила протокол доказуемо безвредного для производительности водяного знака для моделей с чёрным ящиком (IEEE TDSC 2026): используя криптографический код аутентификации сообщений для создания указателя ветвления, вероятность срабатывания водяного знака для обычного пользователя становится пренебрежимо малой в вычислительном смысле, сводя безвредность для производительности к криптографической безопасности.
«Доказуемая безвредность» таким образом распространилась с генерируемого контента на саму модель.
От «эмпирической безопасности» к «доказуемой безопасности»
Невидимый водяной знак Anthropic вызвал споры в первый же день запуска: авторы беспокоились о принадлежности авторства, разработчики — «не снизит ли водяной знак качество генерации». Пионеры отрасли выбрали «инженерный быстрый бег», а цель «точного нанесения, без вреда, устойчивости к переписыванию и стиранию, с предоставлением убедительных доказательств» требует прочной теоретической основы.
От идеи Шеннона, поставившего сложную задачу, до теоретической структуры Блума и других, от первого алгоритма генеративной доказуемо безопасной стеганографии в 2018 году до водяного знака большой модели Spark и водяного знака Claude, скрытие информации прошло семьдесят семь лет, наконец, перейдя от «эмпирической безопасности» к «доказуемой безопасности», превратив «беспокойство о вреде водяного знака для модели» в «математически доказанную безвредность» — как для генерируемого контента, так и для самой модели — предоставив теоретически обоснованную техническую поддержку для управления контентом ИИ.
Атаки и защита водяных знаков
Спроектировать водяной знак сложно, стереть — легко. Хотя не всегда. Спроектировать водяной знак нужно так, чтобы одновременно добиваться безвредности для качества и робастности, а атакующему также нужно стереть водяной знак в рамках ограничений по качеству.
Без ограничений водяной знак легко стереть. Переписывать предложение за предложением, чтобы стереть водяной знак, можно ли ещё считать это контентом, созданным исходной моделью? Возможно, проще напрямую использовать другую открытую модель для генерации.
Как и в других областях безопасности, стороны атаки и защиты играют в игре, каждая в своих ограничениях, наличие и атак, и защиты делает это технологическое направление жизнеспособным.
А «безвредность» — это ограничение и цель для обеих сторон.
Защищающаяся сторона не хочет жертвовать качеством генерации из-за внедрения водяного знака; атакующая сторона также не хочет снижать качество из-за стирания водяного знака.
Абсолютной безопасности никогда не бывает, смысл защиты в том, чтобы создать максимально возможные затраты для атаки. Суть атаки и защиты — это игра затрат, то же самое и с водяными знаками.
Эта статья взята из WeChat-аккаунта «新智元», автор: 新智元








