El 11 de agosto de 2026, Anthropic anunció: desde el 2 de agosto, los nuevos modelos Claude publicados incorporarán directamente una marca de agua invisible e ilegible para el ojo humano pero legible por máquina en el texto generado, permitiendo que el contenido generado por IA pueda ser identificado y rastreado por software incluso después de ser copiado y difundido.
La documentación oficial escribe: «Cuando los modelos Claude compatibles generan texto, incrustan directamente una marca de agua apenas perceptible en el texto. Usted no la verá, y no alterará la semántica, la calidad ni la legibilidad de las respuestas de Claude.»
Este mecanismo cubre todos los productos, incluida la interfaz web de Claude, la API y Claude Code, y entra en vigor para usuarios de todo el mundo sin posibilidad de desactivación; los archivos generados como imágenes también incluirán metadatos de trazabilidad con firma digital conforme al estándar C2PA.
Esta es una medida emblemática tras la firma por parte de Anthropic del código de conducta de transparencia del artículo 50 de la Ley de Inteligencia Artificial de la UE.
«Marcar con agua» el contenido generado por IA está pasando de ser una iniciativa empresarial a un consenso global. En junio de 2025, el Foro Económico Mundial publicó en el Foro de Davos de Verano en Tianjin «Las 10 principales tecnologías emergentes de 2025», donde la «marca de agua generativa» ocupó el segundo lugar; el futurista Kevin Kelly predijo en «2049: Posibles 10.000 días futuros» que la era de la IA necesita «redefinir lo real», necesitando «añadir marcas que distingan lo verdadero de lo falso, similares a marcas de agua, en imágenes y vídeos generados por IA».

Figura 1 Foro de Davos de Verano y predicción de Kevin Kelly
Pero hacer la marca de agua «correctamente» no es fácil.
El mismo día del anuncio de Anthropic, la principal duda de los usuarios fue precisamente: ¿la marca de agua perjudicará al modelo? ¿Reducirá la calidad de generación?
El «rendimiento comprobablemente sin pérdidas» se convirtió así en la proposición central de la investigación en ocultación de información en la era GenAI. Para entender esta proposición, hay que volver a su origen teórico: la esteganografía de seguridad demostrable.
Esteganografía de seguridad demostrable, esperando a los modelos generativos durante veinte años
La esteganografía y la marca de agua pertenecen a la ocultación de información. La esteganografía tradicional se mantuvo durante años en una «seguridad empírica»: probar la fortaleza de seguridad de la esteganografía con algoritmos de detección, pero sin poder dar garantías matemáticas. La esteganografía de seguridad demostrable requiere probar rigurosamente: los datos portadores del mensaje secreto y los datos normales son indistinguibles en su distribución.
Esta línea teórica tiene una larga historia.
En 1949, Shannon señaló la dificultad de establecer una teoría de comunicación encubierta; en 1998, Cachin introdujo la entropía relativa, dando una definición de seguridad en términos de teoría de la información; en 2002, el ganador del Premio Turing, Manuel Blum, supervisó a Hopper y otros para establecer un marco de esteganografía de seguridad computacional, desarrollando en 2004 la esteganografía de clave pública y la negociación encubierta de claves.
Sin embargo, todas las construcciones de esteganografía de seguridad demostrable dependen de una premisa exigente: la distribución del portador debe poder muestrearse con precisión. Como la distribución de los datos naturales es incontrolable, la teoría permaneció inactiva durante años.

Figura 2 Breve descripción de la evolución de la esteganografía de seguridad demostrable
En 2018, los modelos generativos de IA trajeron un punto de inflexión: el modelo primero aprende la distribución y luego muestrea según esa distribución, proporcionando naturalmente un «muestreador explícito o perfecto de la distribución».
El equipo de la Universidad de Ciencia y Tecnología de China (USTC) propuso por primera vez a nivel internacional la idea de esteganografía generativa de seguridad demostrable, presentando dos marcos: «muestreo de caja negra» y «muestreo comprimido-reversible» (IWDW 2018, arXiv 2018), reduciendo la seguridad esteganográfica a la seguridad del algoritmo de cifrado: cifrar el mensaje en un texto cifrado pseudoaleatorio, usar el texto cifrado para impulsar la generación de contenido mediante muestreo, y que el receptor recupere el texto cifrado mediante muestreo inverso.
En ese momento, la IA generativa aún no había explotado, y esta idea parecía «adelantada», dificultando inicialmente la aceptación por parte de la comunidad académica. Con la rápida mejora de la calidad de los modelos generativos de audio, etc., los resultados relacionados fueron gradualmente reconocidos. El International Workshop on Digital Watermarking (IWDW) invitó al equipo de la USTC a dar la conferencia plenaria titulada «When Provably Secure Steganography Meets Generative Models».

Figura 3 El primer artículo sobre esteganografía generativa de seguridad demostrable
Alrededor de 2021, cuando los datos generados por IA se convirtieron gradualmente en la forma principal del contenido en línea, la esteganografía de seguridad demostrable recibió una amplia atención a nivel mundial: la Universidad de Tsinghua propuso esteganografía lingüística de seguridad demostrable basada en agrupación de muestras (Findings of ACL 2021); la Universidad de Boston y la Universidad Johns Hopkins propusieron Meteor, una esteganografía criptográficamente segura para distribuciones reales (ACM CCS 2021); la Universidad de Oxford propuso esteganografía perfectamente segura basada en acoplamiento de entropía mínima (ICLR 2023).
El equipo de la USTC propuso la construcción Discop basada en «réplicas de distribución» (IEEE S&P 2023), mejorando significativamente la tasa de carga útil de incrustación. Ese mismo año, Quanta Magazine calificó la «ocultación perfecta de información secreta en datos generativos» como uno de los siete grandes avances internacionales en informática del año, declarando la entrada de la ocultación de información en la era «demostrable».
De simétrica a asimétrica, de «con caja» a «sin caja»
Las primeras esteganografías generativas de seguridad demostrable eran todas de esquema de «clave simétrica», donde emisor y receptor debían compartir una clave previamente y dependían de la extracción de caja blanca, limitando los escenarios de uso.
Además, la ambigüedad de los sub-tokens (subpalabras) podía causar fallos en la extracción. El equipo de la USTC llevó la línea tecnológica hacia la esteganografía de clave pública, escenarios sin caja/con caja gris y eliminó la ambigüedad de sub-tokens, haciendo que la ocultación generativa fuera práctica.
Esteganografía de clave pública (IEEE TIFS 2024): propuso un esquema de esteganografía de clave pública de seguridad demostrable que combina criptografía de curva elíptica (ECC) con modelos generativos, y propuso un protocolo de intercambio de claves esteganográficas. Resolvió los problemas de negociación de claves esteganográficas y extracción «asimétrica» de información oculta.
Esteganografía sin caja (IEEE TMM 2026): los métodos tradicionales dependían de la extracción de «caja blanca», el receptor debía tener exactamente el mismo modelo de lenguaje que el emisor. El equipo propuso Disreo, logrando «extracción sin caja» mediante la aleatorización de posiciones de tokens y la recombinación de probabilidades de salida, permitiendo al receptor recuperar el mensaje sin acceder al modelo subyacente, proporcionando mayor conveniencia para el despliegue real.
Esteganografía de caja gris (ACM CCS 2026): entre caja blanca y sin caja existe el escenario de «caja gris»: los recursos de emisor y receptor no son equivalentes, el receptor podría tener solo capacidad para ejecutar modelos pequeños (por ejemplo, en dispositivos móviles). SpecStega se basa en el muestreo especulativo (speculative sampling): utiliza un modelo pequeño compartido por ambas partes para incrustar y extraer el mensaje, y luego refina la salida con el modelo objetivo grande, de modo que el texto final portador del secreto se alinee con la distribución de salida del modelo grande, manteniendo alta calidad y seguridad, y a la vez pueda ser decodificado eficientemente en el extremo receptor solo con el modelo pequeño, aumentando la tasa de carga útil hasta 20 veces más en comparación con los esquemas de caja negra existentes, proporcionando un tercer camino para la esteganografía de seguridad demostrable entre «con caja» y «sin caja».
Resolución de ambigüedad de sub-tokens (IEEE TDSC): la esteganografía basada en grandes modelos de lenguaje enfrenta comúnmente la ambigüedad de decodificación de tokens: un mismo texto puede ser dividido en diferentes secuencias de sub-tokens, causando fallos en la extracción. El equipo propuso SyncPool, agrupando de manera unificada antes de la incrustación los tokens que tienen relaciones de prefijo, eliminando la ambigüedad desde el principio y logrando una extracción fiable en esteganografía de seguridad demostrable.
De esteganografía a marca de agua, llevando la «inocuidad demostrable» a la industria
Los grandes modelos AIGC primero aprenden la distribución de los datos naturales, luego generan texto, imágenes, audio, vídeo, etc., muestreando según esa distribución. Si se logra: incrustar una marca de agua en el contenido generado sin afectar la distribución de muestreo, eso significa que la incrustación de la marca de agua no afecta la calidad de generación.
La esteganografía de seguridad demostrable garantiza teóricamente que la distribución de los datos portadores del secreto y de los datos generados normales sea indistinguible, es decir, que la incrustación de información no altera la distribución de muestreo del modelo, precisamente la definición de «marca de agua generativa comprobablemente sin pérdidas de calidad». La marca de agua no necesita la gran capacidad de la esteganografía, por lo que también se puede intercambiar capacidad por robustez.
En el ámbito del texto, el sistema de marca de agua generativa comprobablemente sin pérdidas de calidad desarrollado por el equipo de la USTC es plug-and-play, no requiere modificar parámetros del modelo, soporta identificación robusta de un solo bit y atribución de modelo de múltiples bits, y ya se ha aplicado en plataformas como el gran modelo Spark, el modelo GPT seguro, etc., sirviendo a 13,000 desarrolladores.
Al mismo tiempo, la investigación internacional sobre marcas de agua de texto generativo comprobablemente sin pérdidas también avanza rápidamente:
En 2024, el equipo de la Universidad de Maryland y otros en «Unbiased Watermark for Large Language Models» (ICLR 2024 Spotlight) definieron la marca de agua imparcial y dieron una construcción general;
Ese mismo año, la Universidad de Stanford propuso una marca de agua imparcial robusta contra distorsiones (TMLR 2024);
En 2025, la marca de agua imparcial multicanal MCmark (ACL 2025) mejoró la robustez de la extracción de la marca de agua manteniendo la imparcialidad estricta.
En el ámbito de imágenes, el equipo de la USTC propuso Gaussian Shading (CVPR 2024), mapeando la marca de agua aleatorizada y cifrada a variables latentes gaussianas indistinguibles de la generación normal, luego actuando a través del proceso de difusión en todo el espacio latente, sin necesidad de entrenamiento, plug-and-play, comprobablemente sin pérdidas de rendimiento;
Gaussian Shading++ y T2SMark (NeurIPS 2025) resolvieron aún más los problemas de robustez en despliegue real, variación de parámetros de generación y diversidad de generación;
TAG-WM (ICCV 2025) introdujo un mecanismo dual de «marca de agua de plantilla + marca de agua de información», logrando simultáneamente localización de manipulación y confirmación de propiedad bajo la premisa de inocuidad;
SemBind (ICML 2026) vincula la marca de agua con la semántica de la imagen mediante un enmascarador semántico, resistiendo ataques de falsificación de caja negra.

Figura 4 Marca de agua generativa de imágenes comprobablemente sin pérdidas Gaussian Shading (CVPR 2024)
De marca de agua de contenido a marca de agua de modelo. El modelo en sí es también un activo digital importante que necesita una prueba de pertenencia confiable, y la marca de agua de modelos siempre enfrenta una duda: ¿afectará el uso normal del modelo?
Inspirándose en la construcción de «puerta trasera comprobablemente indetectable» propuesta por la ganadora del Premio Turing Shafi Goldwasser y otros en FOCS 2022, el equipo de la USTC propuso un protocolo de marca de agua de modelo de caja negra comprobablemente sin pérdidas de rendimiento (IEEE TDSC 2026): usando un código de autenticación de mensajes imposible de falsificar para construir un indicador de ramificación, haciendo que la probabilidad de que un usuario normal active la rama de la marca de agua sea computacionalmente despreciable, reduciendo así la propiedad de inocuidad de rendimiento a la seguridad criptográfica.
Así, la «inocuidad demostrable» se extendió desde el contenido generado al modelo en sí.
De «seguridad empírica» a «seguridad demostrable»
La marca de agua invisible de Anthropic generó controversia el primer día de su lanzamiento: los escritores preocupados por la atribución de autoría, los desarrolladores preocupados por «¿la marca de agua reducirá la calidad de generación?». Los pioneros de la industria eligieron «correr rápido en ingeniería», pero el objetivo de «ser precisa, no dañar, resistir reescrituras y borrados, y poder dar evidencia determinante», exige un sólido respaldo teórico.
Desde la concepción del problema desafiante planteado por Shannon hasta el marco teórico de Blum y otros, desde el primer algoritmo de esteganografía generativa de seguridad demostrable en 2018 hasta la marca de agua del gran modelo Spark y la marca de agua de Claude, la ocultación de información ha recorrido setenta y siete años, finalmente cruzando y actualizándose de «seguridad empírica» a «seguridad demostrable», transformando la «preocupación de que la marca de agua dañe el modelo» en una «prueba matemática de inocuidad», ya sea para el contenido generado o para el modelo en sí, proporcionando un soporte tecnológico con garantías teóricas para la gobernanza del contenido de IA.
Ataque y defensa de la marca de agua
Diseñar marcas de agua es difícil, eliminarlas es fácil. En realidad, no del todo. Diseñar marcas de agua requiere buscar simultáneamente inocuidad de calidad y robustez, mientras que el atacante también necesita eliminar la marca de agua bajo restricciones de calidad.
Sin restricciones, la marca de agua es fácil de eliminar. Reescribir frase por frase para borrar la marca de agua, ¿sigue siendo contenido generado por el modelo original? Quizás sea mejor usar directamente otros modelos de código abierto para generar.
Como en otros campos de seguridad, atacantes y defensores juegan bajo sus propias restricciones, con ataques y defensas, esta dirección tecnológica tiene vitalidad.
Y la «inocuidad» es la restricción y búsqueda de ambas partes.
El defensor no quiere sacrificar la calidad de generación por incrustar la marca de agua; el atacante tampoco quiere reducir la calidad al eliminar la marca de agua.
Nunca ha habido seguridad absoluta, el significado de la defensa es crear el mayor costo posible para el ataque. La esencia del ataque y la defensa es un juego de costos, lo mismo ocurre con la marca de agua.
Este artículo proviene del WeChat Official Account «新智元», autor: 新智元







