为遵守欧盟《人工智能法案》,Anthropic将为Claude生成的文本添加隐形水印。该技术基于Google DeepMind的SynthID-Text方案,不影响输出质量,不增加成本,并可通过API检测文本是否由Claude生成。本文详解其工作原理、局限性与隐私影响。
未来版本的 Claude 模型生成的文本将带有水印。这是一种判断文本是否由 Claude 参与编写的技术手段。为了符合欧盟《人工智能法案》,Anthropic 与多家主流 AI 提供商正在实施这一改动。
以下是关于水印的一些常见问题的解答,包括原理、对输出的影响以及原因。
要点速览:
大语言模型(如 Claude)逐词生成文本。每次决定下一个词时,模型会从候选词列表中选出最合适的一个。比如“今天天气寒冷且……”这句话,下一个词几乎不可能是“甜腻的”,但很可能是“阴天”或“灰蒙蒙”。在很多情况下,选哪个词对读者来说意义差别不大。此时,选择由随机数决定。
水印利用这些低风险的选择(在生成文本中会多次出现)在 Claude 的回答中留下一种模式。该模式对读者不可见,但持有密钥的人可以检测到。加水印时,选择仍是随机的,但随机性的来源不同:不是用任意随机数生成器选词,而是使用密钥和前面几个词来决定选哪个词。也就是说,Claude 选的词仍然是随机的,但可以检查词序列是否与使用密钥时的选择一致。如果是,就可以推断出该文本由 Claude 生成的概率。
重要的是,模型并不会偏向于“阴天”或“灰蒙蒙”。与无水印文本一样,可能某句选“阴天”,下一句选“灰蒙蒙”,取决于前面的词。水印也不会让 Claude 选一个原本不会考虑的词(比如“nubilous”这种生僻词)。
水印不影响 Claude 的输出质量。读者看不出带水印与未带水印的文本有何不同(这与纸币或物理物品上的可见水印有本质区别)。
内部测试显示,水印对 Claude 的内容、创意或可读性没有影响。在介绍该技术的 SynthID-Text 论文中,Google DeepMind 将带水印的模型用于一部分 Gemini 流量,对比点赞与点踩情况,未发现与未带水印模型有统计学显著差异。在对照研究中,人工评估员并排比较也看不出质量差异。
一个有用的类比是玩大富翁游戏。每轮每位玩家掷骰子随机移动。假设不掷骰子,而是用圆周率数字的书籍,从某个随机位置开始,每个玩家取序列中的下一个数字作为“掷数”。本质上,移动仍然是随机的,对玩家和结果没有影响。但如果能看到所有移动序列(并知道圆周率),就能判断这局游戏是否用了圆周率。也就是说,用圆周率的游戏“带水印”了。
Claude 生成的文本也是如此。水印不改变读者的阅读体验,但事后可以检测文本是否由 Claude 生成。
Claude 的文本水印是 Google DeepMind 在 2024 年 Nature 论文中发布的 SynthID-Text 方法的一个版本,该方法可追溯到 Scott Aaronson 在 2022 年的提案。这些方法都遵循相同设计原则——水印只改变选词时的随机性来源。
水印有一定局限。使用密钥只能回答“文本有多大程度由 Claude 编写?”无法确认是否人类撰写,也无法判断是否由其他 AI 生成(即使其他 AI 也使用水印,密钥不同或方法不同)。在样本较小时效果不佳,因为可选择的词少,信息量不足。文本越长,对 Claude 参与度的判断越有信心。
在事实性文本中,水印较稀疏,因为可替换的词很少。例如“艾萨克·牛顿最著名的著作是《自然哲学的数学原理》……”,下一个词只有“数学”是正确的,水印无从着力。校对也是如此,如果只修改语法和标点,水印只能附着在少数几个修改上,数量可能不足以被检测到。
水印只作用于 Claude 选择的词。当 Claude 校对一篇由人写的文字时,返回的往往只是少量修改;因为几乎所有的词都是原作者写的,水印几乎没有附着点。根据文本长度和编辑程度,这些修改可能不足以检测出 Claude 的参与。Claude 写的内容越多,做出的决策越多,水印的空间也越大。
如上所述,AI 水印利用的是“两种选择都合理”的决策点。当需要精确输出、没有选择余地时(比如“2+2=”后面的答案必须是“4”),水印不会被应用。同样,代码在很多情况下必须精确,因此水印通常少于其他文本。但在代码中确实存在任意选择的地方(如注释中的用词),水印可以应用,但对实际代码的影响微乎其微。
这是为了遵守欧盟《人工智能法案》。Anthropic 与其他几家主要 AI 提供商以及共约 190 个签署方在 2026 年 7 月签署了欧盟《AI 生成内容透明度实践准则》。这要求 AI 系统提供商使用“标记”AI 生成文本的方法。Anthropic 在发布时在全球范围内应用水印,因为目前还没有按地区划分的持久方案。未来会继续评估不同方式。
如何检查一段文本是否由 Claude 撰写? 很快将推出水印检测 API,细节正在制定中。
图像和其他文件呢? 当 Claude 生成支持类型的文件(如 .png、.jpg 或 .svg)时,会在文件元数据中添加一个小型加密签名的内容凭证,表明该文件由 Claude 制作或处理。这是开放行业标准 C2PA,与相机和照片编辑软件使用的相同。任何支持 C2PA 的工具都能读取,也会提供自己的工具。
有人通过编辑文本绕过水印怎么办? 一定程度上可以。轻度编辑可能不会完全移除水印;但彻底重写替换每个词,水印就会消失。当然,后者是否还能称为 AI 生成就另当别论了。
水印能证明什么? 只能确定 Claude 很可能参与过内容生成,无法区分“Claude 写了”还是“Claude 重度编辑”。
翻译有水印吗? 有。Claude 的翻译每词都是 Claude 选择的,因此携带水印。
旧版 Claude 模型呢? 欧盟法律对 2026 年 8 月 2 日前发布的 Anthropic 模型有过渡期,正在为这些模型添加水印,将在未来几个月内推出。
与 AI 检测软件(如 Pangram)有何不同? AI 检测软件使用不同方法,因为其提供商没有密钥。它们会分析文本中 AI 常用的措辞模式。例如 AI 似乎喜欢“这不是 X,而是 Y”的结构,使用“quietly”的频率也较高。这与检查水印根本不同。
这会改变输出内容的所有权或法律责任吗? 不会。水印只帮助测试 Claude 是否可能生成或处理了内容,不涉及所有权或作者身份,也不改变用户在条款下的权利。只有当 Claude 参与处理内容或文件时才应用水印。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断