Claude 的文本水印是如何工作的
未来的 Claude 模型将生成包含水印的文本。这是一种判断 Claude 是否可能参与了文本写作的方式,我们与其他几家主要 AI 提供商一起实施这一变更,以遵守欧盟《人工智能法案》。
在本文中,我们回答了一些收到的问题,涉及我们所选用的水印方法如何工作、它是否影响 Claude 的输出,以及我们为何做出这一变更。概括如下:
- 我们使用的水印方法对 Claude 输出的质量或内容没有任何实际影响;
- 读者无法区分带水印与不带水印的文本;
- 文本中不会添加任何内容,也不存在隐藏字符;
- 水印不需要额外的 token,也不会更昂贵;
- 水印不携带任何身份识别信息,无法追溯到特定个人、组织或对话;
- 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求在其市场提供服务的 AI 提供商对 AI 生成的内容进行标记。其他主要模型开发者已签署同一《实践准则》,并将实施各自的水印。
什么是水印?
像 Claude 这样的大型语言模型的工作方式是逐词生成。每当模型决定下一个词时,它会在一个潜在候选词列表中做出选择,最终根据前文选出最合理或最可能的词。以句子“The weather today was cold and…”(今天的天气寒冷而……)为例。下一个词极不可能是“sugary”(含糖的)。但很可能是“overcast”(阴天的)或“grey”(灰暗的)。在大多数情况下,模型最终选择后两个词中的哪一个,对读者来说并不重要——无论选哪个,句子的含义基本相同。在这种情况下,选择由一个随机数决定。
水印利用的就是这类无关紧要的选择——它们在一段生成的文本中会出现很多次——在 Claude 的回复中留下一种模式。这种模式对读者来说无法察觉,但是任何拥有编码该模式密钥的人都能检测到的。使用水印时,选择仍然是随机做出的,但随机性的来源不同。水印不是使用任意的随机数生成器来挑选下一个词,而是使用密钥和前面的几个词来决定模型应选择哪个词。也就是说,Claude 选择的词仍然是随机的,但现在,人们可以检查词的序列,看它是否与 Claude 在使用该密钥时会做出的选择一致。如果一致,就可以给出一个概率,表明该文本是由 Claude 生成的。
重要的是,这并不意味着模型现在总是偏向“overcast”或“grey”。与非水印文本一样,可能在一个句子中选中“overcast”,在下一个句子中选中“grey”,取决于前面的词。而且,水印方法并不会促使 Claude 选择一个它本来根本不会考虑的詞(例如,它不会让 Claude 选择像“nubilous”这样的词——“overcast”或“grey”的一个生僻 1 同义词,Claude 在正常情况下几乎肯定不会使用)。
水印如何影响 Claude 的输出?
水印不会影响 Claude 输出的质量。对读者而言,带水印的回复与不带水印的回复无法区分(在这方面,AI 水印与纸币、其他实物以及某些数字文件上的同名水印有本质区别,后者是肉眼可见的)。
在内部测试中,我们未发现水印对 Claude 文本的内容、创造力水平或可读性有任何影响。在介绍我们所使用技术的 SynthID-Text 论文中,Google DeepMind 通过将使用水印的模型服务于部分 Gemini 流量,并比较点赞和点踩评分来测试这一影响。他们发现与未加水印的模型相比,没有统计学上的显著差异。在一项对照研究中,人类评分者并排比较带水印和不带水印的答案,也未发现质量差异。
一个有用的类比是想象你在玩类似大富翁的游戏。每一回合,每位玩家根据骰子的点数在棋盘上随机移动若干格。假设我们不用掷骰子来获得这种随机性,而是决定使用一本圆周率数字书。2 我们从一个随机选择的数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那时起,每位玩家只需使用序列中的下一个数字作为他们的下一次“掷骰”。
实际上,移动仍然是随机的:对玩家——或对游戏结果——来说,随机性来自圆周率还是每次掷骰子并无区别。但如果我们能在游戏后看到所有移动的序列(并且我们知道圆周率的值),我们就能推断出这是否是一场可能使用圆周率来决定其移动的游戏。从某种意义上说,使用圆周率的游戏被“加了水印”。
Claude 生成的文本也是如此。水印不会改变阅读者的含义或体验,但如果你想事后检查文本是否可能由 Claude 生成,水印允许你这样做。
你们使用哪种具体的水印方法?
Claude 的文本水印是 Google DeepMind 于 2024 年在 《自然》论文中发布的 SynthID-Text 方法的一个版本。它属于可追溯到 Scott Aaronson 在 2022 年提出的一项提案的一系列方法,所有这些方法都共享我们上面描述的相同设计原则——水印只改变用于选择词语的随机性来源。
水印的有效性存在局限性。使用我们的密钥,只能回答“这段文本部分由 Claude 撰写的可能性有多大?”它不能确认文本是否由人类撰写,也无法判断文本是否由其他 AI 撰写(即使其他 AI 使用水印,它也会有不同密钥;它也可能使用完全不同的水印方法)。在样本较小时,检测水印效果也不佳,因为此时词语选择较少,可供依据的信息也更少。随着段落长度增加,对 Claude 参与度的置信度也会增加。
在事实性段落中,水印更为稀疏,因为在不降低文本准确性的前提下,可做的选择更少。例如,以句子“艾萨克·牛顿最著名的著作名为*《原理》*……”为例。下一个词是否为“数学”至关重要(这是唯一正确答案),因此水印无从下手。校对也是如此。如果你交给克劳德一篇文章,要求它只编辑语法和标点,不修改其他内容,那么水印只能存在于少数几处修正中,可能太少而无法被识别。
克劳德校对或编辑人类文本的情况呢?
水印仅适用于克劳德选择的词语。当克劳德校对由人撰写的文本时,它返回的内容通常只经过轻微编辑;因为几乎所有词语都是作者的,水印几乎没有(如果有的话)附着点。根据文本的长度和克劳德编辑的程度,这些改动可能不足以使克劳德的参与可被检测到。克劳德写得越多,它必须做出的决定就越多,水印的空间也就越大。
代码呢?
如上所述,AI水印利用的是词语选择上两种选择同样好的决策点。在需要精确输出的地方——没有选择余地,如果选择不同的术语会导致事实错误或代码出错——水印不会被应用。
例如,一旦模型写下了“2 + 2 =”,下一个标记的最佳选择非常明确(如果模型是在完成求和,没有哪个答案能像“4”一样好;如果是在谈论乔治·奥威尔的《一九八四》,没有哪个答案能像“5”一样好)。水印的“推动”在这里不会被应用。出于同样的原因,代码——在许多情况下必须精确——通常比其他形式的文本水印更少。
话虽如此,在代码中特定词语或术语之间存在任意选择的领域,水印可以使用,例如代码中的注释。但根据定义,它对实际生成的代码影响微乎其微。
这对用户意味着什么?
这会减慢模型速度或使其更昂贵吗?
不会。水印对模型速度的影响微乎其微,并且由于它不产生额外的标记,模型的 serving 和使用成本相同。
水印能追溯到我或我的组织吗?
不能。水印适用于克劳德及其输出。它不识别与个人用户相关的任何信息。水印或其密钥中没有任何内容能让任何人恢复关于用户、其组织或他们与克劳德对话的任何信息。
为什么你要给克劳德的输出加水印?
为什么你要给克劳德的输出加水印?
我们正在实施水印技术,以遵守欧盟《人工智能法案》。Anthropic 与其他几家主要 AI 模型提供商以及约 190 个签署方 于 2026 年 7 月签署了《欧盟人工智能生成内容透明度实践准则》。该准则要求 AI 系统提供商使用对 AI 生成文本进行“标记”的方法。我们在发布时全球统一应用水印,因为我们目前还没有一种持久的方式按地区来限定范围。不过,我们将继续评估不同的方法,并在有更新时与大家分享。
其他问题
我如何检查一段文本是否由 Claude 撰写?
我们正在私下预览阶段发布一个检测 API。根据欧盟法律的要求,它目前向符合条件的组织开放(例如监管机构、执法部门、媒体、事实核查机构、独立研究人员、教育组织和欧盟民间社会团体)。对于同样有义务为自身遵守该法案而验证水印的企业,它也可用。我们计划随着时间推移扩大检测 API 的访问范围。你可以在这里登记访问意向。
图像和其他文件呢?
当 Claude 生成受支持类型的文件(例如 .png、.jpg 或 .svg)时,它会在文件元数据中附加一个内容凭证,形式为一条经过加密签名的小型说明,表明该文件是使用 Claude 制作或处理的。这是一种名为 C2PA 的开放行业标准——相机厂商和照片编辑软件也使用同一标准来记录图像的来源。任何支持 C2PA 的工具都可以读取它;我们将提供我们自己的工具,你可以把文件拖进去进行检查。
这种元数据标签与水印非常不同。文件中的任何内容都不会改变——它不是嵌入的,也不是隐藏的。与文本一样,该凭证只说明 Claude 参与了该文件的生成;它不包含任何可识别身份的信息。
难道有人不能直接编辑文本以绕过水印吗?
在某种程度上,可以。轻度编辑可能不会完全移除水印;而将每个词都替换掉的彻底重写则会。在后一种情况下,当然,这段文本是否还能被称为 AI 生成的就值得商榷了。
水印实际上能证明什么?
水印只能确定 Claude 很可能在某个时候参与了该内容。它无法区分“Claude 写了这个”和“Claude 大量编辑了这个”。
水印适用于翻译吗?
是的。由 Claude 生成的翻译带有水印,因为在这种情况下,每个词都是由 Claude 选择的。
较旧的 Claude 模型呢?
欧盟法律为 2026 年 8 月 2 日之前推出的 Anthropic 模型包含了一个过渡期,我们正在努力为这些模型也添加水印。这将在未来几个月内逐步推出。
这与 Pangram 等 AI 检测软件有何不同?
AI 检测软件使用一种不同的方法,因为提供这类软件的公司并没有我们的密钥。除此之外,这些服务还会考察文本的各个方面,比如 AI 措辞中常出现的那些细微(以及不那么细微)的“破绽”。例如,AI 模型似乎很喜欢“这不是 [X],而是 [Y]”这种句式,并且使用“quietly”一词的频率远高于你的预期。识别这些模式与检查水印在本质上是不同的。
这会改变某一给定输出的归属,或对其负有法律责任的主体吗?
不会。水印只能帮助判断 Claude 是否可能生成或处理过该内容。它不涉及任何关于所有权或作者身份的信息,也不会改变用户在我们条款下享有的权利。我们仅在 Claude 参与处理该内容或文件时才会应用水印。
*2026 年 9 月 1 日更新:*提供了关于水印检测 API 的最新信息。
相关内容
与我们的客户共同制定企业前沿保障措施
改进我们的对齐与安全工作
7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与 METR 合作开展独立审查。与此同时,我们分享过去一个月中所做的一些改动。
预览模型硬件标准
我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。
