返回新闻
政策AI Understanding 简报

Anthropic 详细说明 Claude 的文本水印如何工作

Anthropic 表示未来的 Claude 模型将嵌入基于 Google DeepMind 的 SynthID-Text 的统计水印,以遵守欧盟人工智能法案。该公司表示,它没有添加任何字符、令牌或用户身份,并且完全重写会失败。

6 min readRead the primary source
Source-page capture accompanying Anthropic Details How Claude's Text Watermark Will Work
主要来源文件来源记录
出版商
anthropic.com
来源链接
anthropic.comhttps://www.anthropic.com/news/claude-text-watermark
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
水印
在人工智能生成的文本或媒体中嵌入可检测信号,以便稍后将其识别为机器生成的。
稳健性
模型在噪声、变化或对抗性输入下保持性能的能力。
测试一下自己人工智能道德测验

发生了什么

在 2026 年 8 月 14 日的解释中,Anthropic 表示未来的 Claude 模型将生成带有统计水印的文本,作为 Google DeepMind 的 SynthID-Text 的版本实现,以满足欧盟人工智能法案透明度规则。这篇文章描述了该方法及其局限性,但没有命名模型、给出开始日期或启动检测器。

Anthropic 于 2026 年 8 月 14 日发布了一份解释说明,描述了文本水印在未来 Claude 模型中的工作方式。该公司将这一变化视为符合《欧盟人工智能法案》:它表示,从 2026 年 8 月 2 日起,为欧盟市场提供服务的提供商必须标记人工智能生成的内容,并且 Anthropic 是 2026 年 7 月《欧盟人工智能生成内容透明度实践守则》的大约 190 个签署者之一。该帖子是一种方法的记录,而不是发布公告。它没有指明哪些型号将带有水印,也没有给出标记开始的日期,也没有说明它是否在今天的任何产品中生效。

该方法被描述为 SynthID-Text 的一个版本,该方案 Google DeepMind 于 2024 年在 Nature 上发表,该帖子将其置于一系列设计中,可追溯到 Scott Aaronson 2022 年的提案。语言模型在大致相同的候选者中部分随机地选择下一个标记。水印将任意随机源替换为从秘密密钥和前面的单词派生的伪随机源,因此可以稍后测试一系列选择与密钥的一致性。 Anthropic 表示文本中没有插入任何内容,没有隐藏字符,没有产生额外的代币,并且价格和速度不变。它还表示,水印不携带任何识别信息,无法追踪到个人、组织或对话。

Anthropic 明确规定了限制。检测结果仅估计 Claude 参与产生通道的可能性。它无法证明文本是人类编写的,也无法识别其他人工智能系统,这些系统将使用完全不同的密钥或不同的方法。检测在短样本上的效果很差,并且在措辞受到限制的地方标记也更稀疏——具有正确完成、算术和代码的事实陈述,其中帖子说对代码本身的影响可以忽略不计,并且水印主要存在于注释中。对人类文本进行轻微校对可能会留下太少的 Claude 选择的单词进行注册。完全重写会删除该标记;该公司表示,轻度编辑可能不会。该帖子还指出,水印没有说明输出的所有权、作者身份或法律责任。

除了文本之外,Anthropic 还表示 Claude 以受支持的格式(例如 .png、.jpg 和 .svg)生成的文件将携带 C2PA 内容凭证——文件元数据中的加密签名注释,是开放行业标准的一部分,记录 Claude 在不更改文件本身的情况下参与其中。该公司表示即将推出水印检测 API,但实施细节仍在制定中,并将提供自己的工具来检查 C2PA 凭证。 Anthropic 表示,水印将在发布时在全球范围内应用,因为它没有持久的方法来按区域确定其范围。 2026 年 8 月 2 日之前发布的 Claude 型号属于欧盟法律的过渡期,并将在未来几个月内涵盖。

来源详情: anthropic.com

为什么这很重要

基于键的水印是比基于样式的人工智能检测器更有力的证据,但它只回答了一个狭隘的问题:一个供应商的模型是否可能触及足够长的段落。负面的结果并不能证明什么,而且这种技术在争议常见的地方是最薄弱的——代码、短文本和经过轻微编辑的人类书写。

出处已成为学校、法院、出版商、招聘和平台审核的一个实际问题,当今使用的大多数工具都是统计检测器,可以根据文体推断推断作者身份——这种方法存在有据可查的误报问题。基于密钥的水印是一种不同类别的证据:持有密钥的一方对其故意放置的模式进行测试,而不是根据样式进行猜测。这在原则上是一个真正的改进,但仅限于它所回答的狭隘问题。

对于任何想在纪律或法律环境中使用这一点的人来说,这种不对称性都很重要。阳性结果表明 Claude 参与;负面结果没有任何意义,因为文本可能来自另一个模型,来自仍处于过渡期的旧 Claude 模型,来自经过大量编辑的草稿,或者来自太短或太受限而无法保留标记的段落。 Anthropic 表示水印无法将“Claude 写了此内容”与“Claude 大量编辑了此内容”分开。将探测器输出视为不当行为证据的机构将建立在其制造商描述为概率性的信号之上。

“没有质量影响”这一说法背后的证据是参差不齐的,值得一提。 Anthropic 引用了尚未发布的内部测试以及 SynthID-Text 论文,其中 DeepMind 报告称,当带水印的模型服务于 Gemini 流量的一部分时,赞成和反对评级没有统计学上的显着差异,并且在受控的并排人类评级研究中也没有感知到差异。这是真正的外部证据,但它涉及不同公司的模式和流量。尚未专门针对 Claude 发布水印强度、误报率或最小通道长度的测量结果。

监管机制也延伸到欧洲以外的地区。由于 Anthropic 表示尚无法按地区划分水印范围,因此通过更改全球用户的输出来履行欧盟透明度义务。实践守则约束了许多提供商,因此其他开发人员也期望获得类似的分数,每个开发人员都有自己的密钥,可能还有自己的方法。这指向了一个支离破碎的验证环境:没有一个检测器覆盖所有模型,通过供应商控制的端点运行检查,以及开放权重模型(其中采样由运行模型的人控制)很大程度上位于方案之外。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
交互式概念检查+10 Points
AI Ethics Quiz

Which of these is a common misconception about AI Ethics?

接下来看什么

未发布的检测 API 将决定这在实践中是否可用:访问术语、置信度分数、误报调整和最小文本长度均未指定。还开放:哪些型号配备了它,2026 年 8 月之前的型号改装的速度有多快,以及全球应用是否随后缩小到欧盟。

检测 API 是确定其中任何一个是否可用的部分。未解决的问题:谁可以访问,是免费的还是按流量计费的,返回的置信度得分是多少,调整的误报率是多少,以及需要的最小文本长度是多少。这些选择决定了水印是成为课堂和人力资源调查中仔细的法证辅助工具还是钝器。 Anthropic 没有给出发布日期。

二是覆盖范围。该帖子没有具体说明哪些即将推出的型号带有水印或何时发货,并且 2026 年 8 月 2 日之前发布的改装型号仅被描述为将在未来几个月内推出。在此完成之前,大量现有的 Claude 输出仍未标记,任何检测器都将存在下游用户无法轻易推断的盲点。

第三,稳健性。研究人员通过释义、跨模型翻译和标记级编辑反复探讨了水印方案,Anthropic 自己的帐户承认完全重写击败了标记。预计会出现已发布的攻击,并且一旦检测 API 存在,就会进行独立的误报分析。这些结果(而不是供应商文档)将确定信号可以承受的重量。

最后,观察全球应用范围是否缩小。 Anthropic 表示将继续评估区域范围并分享更新。同样值得关注的是:其他实践准则签署者如何实施自己的标记,是否出现任何共享验证层,以及欧盟监管机构是否发布了关于什么是代码、短输出和轻度编辑的人类文本的适当标记的指南(这些情况是该技术在设计上最薄弱的情况)。

相关指南和测验

AI 伦理ChatGPT 与大语言模型人工智能模型解释AI 的未来测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语
觉得这有用吗?