Volver a Noticias
PolíticaAI Understanding sesión informativa

Anthropic detalla cómo funcionará la marca de agua de texto de Claude

Anthropic dice que los futuros modelos Claude incorporarán una marca de agua estadística basada en el SynthID-Text de Google DeepMind, para cumplir con la Ley de IA de la UE. La compañía dice que no agrega caracteres, tokens ni identidades de usuario, y que una reescritura completa lo anula.

Por 6 min read
La versión corta

Anthropic dice que los futuros modelos Claude incorporarán una marca de agua estadística basada en el SynthID-Text de Google DeepMind, para cumplir con la Ley de IA de la UE. La compañía dice que no agrega caracteres, tokens ni identidades de usuario, y que una reescritura completa lo anula.

que paso

En una explicación del 14 de agosto de 2026, Anthropic dijo que los futuros modelos Claude generarán texto con una marca de agua estadística, implementada como una versión de SynthID-Text de Google DeepMind, para satisfacer las reglas de transparencia de la Ley de IA de la UE. La publicación describe el método y sus límites, pero no nombra los modelos, no da una fecha de inicio ni lanza un detector.

Anthropic publicó una explicación el 14 de agosto de 2026 que describe cómo funcionará una marca de agua de texto en futuros modelos Claude. La compañía enmarca el cambio como cumplimiento de la Ley de IA de la UE: dice que a partir del 2 de agosto de 2026, los proveedores que prestan servicios en el mercado de la UE deben marcar el contenido generado por IA, y que Anthropic estuvo entre aproximadamente 190 signatarios del Código de prácticas de la UE sobre transparencia del contenido generado por IA en julio de 2026. La publicación es documentación de un enfoque en lugar de un anuncio de lanzamiento. No nombra qué modelos llevarán la marca de agua, no da una fecha en la que comienza el marcado ni dice si está disponible en algún producto hoy.

El método se describe como una versión de SynthID-Text, el esquema Google DeepMind publicado en Nature en 2024, que la publicación ubica en una familia de diseños que se remonta a una propuesta de 2022 de Scott Aaronson. Los modelos de lenguaje eligen cada token siguiente parcialmente al azar entre candidatos que son aproximadamente igualmente buenos. La marca de agua reemplaza esa fuente aleatoria arbitraria con una pseudoaleatoria derivada de una clave secreta y las palabras anteriores, de modo que luego se pueda probar la coherencia de una secuencia de opciones con la clave. Anthropic dice que no se inserta nada en el texto, que no hay caracteres ocultos, que no se producen tokens adicionales y que el precio y la velocidad no cambian. También dice que la marca de agua no contiene información de identificación y no se puede rastrear hasta una persona, organización o conversación.

Anthropic es explícito sobre los límites. Un resultado de detección solo estima la probabilidad de que Claude estuviera involucrado en la producción de un pasaje. No puede demostrar que el texto fue escrito por humanos y no puede identificar otros sistemas de inteligencia artificial, que usarían claves diferentes o métodos completamente diferentes. La detección funciona mal en muestras cortas, y la marca es más escasa cuando la redacción está restringida: declaraciones fácticas con una finalización, aritmética y código correctos, donde la publicación dice que el efecto en el código en sí es insignificante y la marca de agua se encuentra principalmente en los comentarios. Una revisión ligera de texto humano puede dejar muy pocas palabras elegidas Claude para registrar. Una reescritura completa elimina la marca; La edición ligera, dice la compañía, probablemente no lo hará. La publicación también afirma que una marca de agua no dice nada sobre la propiedad, la autoría o la responsabilidad legal de un resultado.

Además del texto, Anthropic dice que los archivos que Claude produce en formatos compatibles como .png, .jpg y .svg llevarán credenciales de contenido C2PA: una nota firmada criptográficamente en los metadatos del archivo, parte de un estándar abierto de la industria, que registra que Claude estuvo involucrado sin alterar el archivo en sí. La compañía dice que está por llegar una API de detección de marcas de agua, pero que aún se están resolviendo los detalles de implementación y que proporcionará su propia herramienta para verificar las credenciales C2PA. La marca de agua se aplicará globalmente en el lanzamiento porque, según Anthropic, no hay una forma duradera de abarcarla por región. Los modelos Claude lanzados antes del 2 de agosto de 2026 se incluyen en un período de transición en la legislación de la UE y estarán cubiertos durante los próximos meses.

Lea la fuente principal: anthropic.com

Por qué es importante

Las marcas de agua basadas en claves son una evidencia más sólida que los detectores de IA basados ​​en estilos, pero solo responden a una pregunta estrecha: si los modelos de un proveedor probablemente tocaron un pasaje lo suficientemente largo. Un resultado negativo no prueba nada, y la técnica es más débil exactamente donde las disputas son comunes: código, texto breve y escritura humana ligeramente editada.

La procedencia se ha convertido en un problema práctico para las escuelas, los tribunales, los editores, la contratación y la moderación de las plataformas, y la mayoría de las herramientas que se utilizan hoy en día son detectores estadísticos que infieren la autoría a partir de indicios estilísticos, un enfoque con problemas de falsos positivos bien documentados. Una marca de agua basada en clave es una clase diferente de evidencia: la parte que posee la clave prueba un patrón que colocó deliberadamente en lugar de adivinar por el estilo. En principio, se trata de una mejora real, pero sólo para la pregunta específica que responde.

La asimetría es importante para cualquiera que se sienta tentado a utilizarla en un entorno disciplinario o legal. Un resultado positivo sugiere participación de Claude; un resultado negativo no establece nada, porque el texto puede haber provenido de otro modelo, de un modelo Claude más antiguo aún en el período de transición, de un borrador muy editado o de un pasaje demasiado corto o demasiado limitado para tener una marca. Anthropic dice que la marca de agua no puede separar "Claude escribió esto" de "Claude editó mucho esto". Las instituciones que traten la salida de un detector como prueba de mala conducta se basarían en una señal que su propio fabricante describe como probabilística.

La evidencia detrás de la afirmación de que "no hay impacto en la calidad" es desigual en un sentido que vale la pena nombrar. Anthropic cita pruebas internas que no se han publicado, además del artículo de SynthID-Text, en el que DeepMind no informó ninguna diferencia estadísticamente significativa en las calificaciones de aprobación y aprobación cuando un modelo con marca de agua atendió una parte del tráfico de Gemini, y no se percibió ninguna diferencia en un estudio de calificación humano controlado lado a lado. Se trata de una auténtica evidencia externa, pero se refiere al modelo y al tráfico de otra empresa. No se ha publicado ninguna medición de la intensidad de la marca de agua, la tasa de falsos positivos o la longitud mínima de paso para Claude específicamente.

Los mecanismos regulatorios también llegan más allá de Europa. Debido a que Anthropic dice que aún no puede determinar el alcance de la marca de agua por región, se cumple una obligación de transparencia de la UE cambiando los resultados para los usuarios de todo el mundo. El Código de prácticas vincula a muchos proveedores, por lo que se esperan puntuaciones comparables de otros desarrolladores, cada uno con su propia clave y, posiblemente, su propio método. Esto apunta hacia un panorama de verificación fragmentado: ningún detector único que cubra todos los modelos, verificaciones que se ejecutan a través de puntos finales controlados por el proveedor y modelos de peso abierto (donde el muestreo está controlado por quien ejecuta el modelo) se encuentran en gran medida fuera del esquema.

Qué ver a continuación

La API de detección no publicada decidirá si esto se puede utilizar en la práctica: los términos de acceso, las puntuaciones de confianza, el ajuste de falsos positivos y la longitud mínima del texto no están especificados. También está abierto: qué modelos se envían con él, con qué rapidez se adaptan los modelos anteriores a agosto de 2026 y si la aplicación global se limita posteriormente a la UE.

La API de detección es la pieza que determina si algo de esto es utilizable. Sin resolver: quién obtiene el acceso, si es gratuito o medido, qué puntuaciones de confianza devuelve, para qué tasa de falsos positivos está ajustado y qué longitud mínima de texto requiere. Esas elecciones deciden si la marca de agua se convierte en una cuidadosa ayuda forense o en un instrumento contundente en las aulas y en las investigaciones de recursos humanos. Anthropic no ha dado fecha de lanzamiento.

En segundo lugar, la cobertura. La publicación no identifica qué próximos modelos llevan la marca de agua ni cuándo se enviarán, y los modelos modernizados lanzados antes del 2 de agosto de 2026 se describen solo como su implementación en los próximos meses. Hasta que esto termine, un gran volumen de salida Claude existente permanecerá sin marcar, y cualquier detector tendrá puntos ciegos sobre los cuales los usuarios intermedios no podrán razonar fácilmente.

En tercer lugar, la robustez. Los investigadores han investigado repetidamente los esquemas de marcas de agua con paráfrasis, traducción entre modelos y ediciones a nivel de token, y la propia cuenta de Anthropic admite que una reescritura completa anula la marca. Espere ataques publicados y, una vez que exista la API de detección, análisis independientes de falsos positivos. Esos resultados, en lugar de la documentación del proveedor, establecerán cuánto peso puede soportar la señal.

Finalmente, observe si la aplicación global se reduce. Anthropic dice que seguirá evaluando el alcance regional y compartirá actualizaciones. También vale la pena realizar un seguimiento: cómo otros signatarios del Código de Práctica implementan sus propias marcas, si surge alguna capa de verificación compartida y si los reguladores de la UE emiten orientación sobre lo que se considera un marcado adecuado para el código, resultados breves y texto humano ligeramente editado: los casos en los que esta técnica es más débil por diseño.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic