Anthropic ha comenzado a implementar SynthID-Text, una marca de agua estadística en los textos generados por Claude que no añade caracteres ocultos ni metadatos, sino que modifica sutilmente la elección de palabras durante la generación. Un análisis técnico con experimentos propios revela que las herramientas que prometen eliminarla no funcionan, mientras que una paráfrasis con otro modelo reduce la detección del 100% al 5% en inglés.
Cómo funciona la marca de agua
El mecanismo, desarrollado por Google DeepMind y publicado en Nature en 2024, altera el proceso de muestreo del modelo. En cada paso, el sistema toma los cuatro tokens anteriores, los combina con una clave secreta y genera valores pseudoaleatorios para cada candidato. El token elegido tiende a tener valores altos bajo esa clave, creando un sesgo detectable solo por quien posee la clave.
La marca vive en la elección de tokens en contextos de cuatro palabras. Si se cambian suficientes términos, los contextos se alteran y la señal desaparece. Además, solo puede existir donde hay entropía: en pasajes factuales o código, donde las opciones son limitadas, la marca es casi inexistente. Los modelos más grandes y alineados generan marcas más débiles porque tienen menos incertidumbre.
Por qué las herramientas populares no la eliminan
Desde el anuncio de Anthropic han proliferado repositorios, skills y webs que prometen quitar la marca. Un análisis de su funcionamiento las clasifica en tres grupos: las que limpian caracteres Unicode invisibles y metadatos (que no tienen relación con la marca), las que reescriben con otro modelo (una paráfrasis normal que nadie puede verificar contra Claude) y las que regeneran el texto completo mostrando puntuaciones de detectores estilométricos sin valor real.
El mito del Unicode proviene de unos espacios especiales detectados en salidas de OpenAI en 2025, que la empresa atribuyó a una rareza del entrenamiento, no a una marca de agua. La realidad es que no hay caracteres que limpiar.
Qué métodos sí rompen la marca
La evidencia científica es contundente. El propio paper de Nature reconoce que tras parafrasear con Gemini Ultra el detector cae a un AUC de 0,55-0,65. Un estudio de ETH Zürich encontró que un parafraseador comercial elimina la marca en más del 90% de los casos. Investigaciones posteriores confirman que ataques que conservan el significado, como la traducción de ida y vuelta, son efectivos.
El ataque más sofisticado es SIRA, que identifica los tokens de alta entropía (donde vive la marca) y los reescribe selectivamente. Con un modelo pequeño y un coste de 0,88 dólares por millón de tokens, logra casi un 100% de éxito contra siete esquemas diferentes.
Experimentos propios: la marca se rompe con paráfrasis
Un análisis independiente reprodujo el mecanismo de SynthID-Text con una clave propia y lo atacó con diversas técnicas. Los resultados en inglés, con 100 textos de unos 300 tokens, muestran:
- Texto sin marca: 0% de detección.
- Texto marcado sin tocar: 100% de detección.
- Limpiador Unicode: 100% de detección (no afecta).
- Borrar el 30% de palabras al azar: 41% de detección.
- Traducción ida y vuelta por español: 76% de detección.
- Traducción por chino: 16% de detección.
- Paráfrasis con otro modelo: 5% de detección.
- SIRA: 4% de detección.
En español la paráfrasis con el mismo modelo deja un 38% de detección, y en textos largos de 1.000 tokens la paráfrasis párrafo a párrafo reduce la detección al 5%. La marca es más débil en modelos grandes y en contenido factual o código.
Implicaciones para SEO y contenido
Ninguna herramienta externa puede detectar la marca de Claude sin la clave de Anthropic. Google no la utiliza para ranking, y lo que realmente valora es el esfuerzo, la originalidad y la escala, no la procedencia del texto. La marca solo indica que Claude o Gemini intervinieron, pero no distingue entre autoría y edición.
El bucle de colapso de modelo ya está en marcha: gran parte del contenido nuevo contiene IA, y los sistemas de búsqueda y entrenamiento se alimentan de él. La marca de agua puede servir para monitorización agregada, pero no para resolver el problema de la trazabilidad.
La conclusión es que la marca de agua de Claude es un sesgo estadístico sin detector público, que las herramientas que prometen eliminarla no lo hacen, y que la paráfrasis con otro modelo abierto es el método más eficaz para romperla, aunque nadie puede verificarlo contra Claude todavía.
