前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.08 · 00:00/8 MIN/作者:苏晚/0 阅读

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

Sebastian Raschka 用 50 张幻灯片讲清了 Claude 文本水印的机制:不是学界常提的绿红名单,是 Google SynthID-Text 那套锦标赛采样。中国合规角度还得再算一笔账——它只覆盖了标识办法的隐式一半。

本文基于 Sebastian Raschka 于 2026 年 8 月 22 日发布的博客与视频讲座 How Claude Watermarks AI-Generated Text 展开。Raschka 是《Build a Large Language Model From Scratch》一书作者,这次他用 50 多张幻灯片和 48 分钟视频,把 Anthropic 8 月 14 日公告里那篇「几乎没有一张图」的水印说明重画了一遍。我们在这个基础上补两件他没展开的事:一个技术上的常见误读,一个中国合规上被忽略的边界。

先把一个流传甚广的误读挡在门外:不是绿名单,是锦标赛采样

国内很多转述稿把 Claude 的水印说成「给一半词表加权、生成时偏向绿名单」——这是 Kirchenbauer 等人 2023 年那篇 A Watermark for Large Language Models 的做法:把词表随机分成绿名单和红名单,采样时在绿名单 logits 上加一个偏置 δ,检测时数被采样文本里绿名单 token 的占比,跑一个 z 检验。逻辑简单,实现门槛低,是学界一年多来的默认参考实现。

但 Raschka 明确指出 Claude 用的不是这套。它走的是 Google DeepMind 2024 年发在 Nature 上的 SynthID-Text 那条路线——锦标赛采样(tournament sampling)。机制不同、失真曲线不同、可检测性也不同,把两者混为一谈会得出错误的合规判断。

简单还原一下锦标赛采样。模型算出下一 token 的概率分布后,先按分布抽一批候选(比如 8 个 token),然后启用一组由密钥派生的随机水印函数 g1、g2、g3……每个函数为每个候选 token 打一位二进制签名,1 或 0。这批候选在多轮两两 PK 中赛跑:g1 打分最高的进入下一轮,再用 g2 淘汰一半,直到剩最后一个胜者。这个胜者就是被输出的 token。

关键之处在于:因为候选本身是按模型正常概率抽出来的,被水印函数「拽」的只是同一批高概率候选之间的排序,不是压低正确答案的概率。这跟绿红名单方案有一个根本区别——绿名单会持续向被随机划为「绿」的那半词表倾斜,输出统计上一定有偏;锦标赛采样只在已经可选的高概率候选里做偏好选择,token 分布的一阶矩理论上没被扰动。这也是 Anthropic 和 Google 都强调「不损失质量」的技术依据,不是营销话术。

Sebastian Raschka 视频讲座第 3 页幻灯片,展示 Anthropic 8 月 14 日公告《How Claude's text watermark works》
图说:Sebastian Raschka 视频讲座第 3 页幻灯片,展示 Anthropic 8 月 14 日公告《How Claude's text watermark works》。图片来源:Sebastian Raschka / magazine.sebastianraschka.com

检测环节的一个反直觉:不需要跑 LLM,也不需要调 Anthropic 的 API

很多人以为「Anthropic 加的水印,得把文本送回 Anthropic 去检」。Raschka 在讲检测部分时特意停下来强调:不需要。检测端手里只要有那批水印函数和密钥种子生成器,就够了。拿到疑似 AI 文本后,按 tokenizer 切成 token,用同一批 g 函数给每个 token 打分,看平均分是否显著高于随机基线。超过阈值判为水印文本,低于则判否。

这个性质有两面。好的一面是:检测方(比如学校、出版机构、搜索引擎)如果能拿到密钥授权,可以本地部署检测器,不用把可疑内容外发,隐私合规友好。差的一面是:一旦密钥泄露,任何人都能一次性绕过水印——不是「更容易」,是「等价于没有」。密钥安全等级从此和 CA 根证书一个量级,而 Anthropic 目前公开的授权路径还没有明说。

Raschka 的一句预言,也是这套水印的物理天花板

讲到「去水印」时,Raschka 讲了一段很诚实的话:水印只被应用在模型有多个高概率候选的 token 位置上,也就是「哪些位置被打了水印」这件事本身就是隐藏信息。你可以粗暴地把所有 token 挨个改一遍,但这会损伤文本质量;你可以只挑一部分改,但你不知道你改的是不是恰好那些被打了水印的位置。

所以他的预言是:**未来常见工作流会变成 Claude 生成 → 本地小模型逐段轻度改写 → 交付。**不需要多么高级的对抗攻击,一个跑在本机上的开源 8B 模型做同义改写、语序调整,就能把水印稀释到检测阈值以下,同时输出仍然可读。这就是为什么 Anthropic 自己在公告里把水印定位为「a way of determining the likelihood」——概率工具,不是判定工具。

落到中文语境还要额外加一个失效场景:翻译。把 Claude 的英文输出机翻或人工翻译成中文,源侧 tokenization 完全打乱,水印函数序列彻底对不上。跨语言场景下的鲁棒性,SynthID-Text 论文里承认是弱项,这个短板在中国场景下会被放大——因为大量 Claude 生成的英文内容在中国传播时都要经过翻译这一步。

现在把镜头切到中国:为什么这套水印只解决了合规的一半

Anthropic 在公告里把 EU AI Act 列为主要驱动力。EU AI Act 第 50 条要求生成式 AI 提供者「以机器可读格式标记合成内容,且可被检测为人工生成」——纯隐式标识就能过关。锦标赛采样水印刚好精准命中这条。

但中国的合规位面不一样。2025 年 3 月 14 日,国家网信办联合工信部、公安部、广电总局发布的《人工智能生成合成内容标识办法》于 9 月 1 日起施行。规定要求生成合成内容必须同时具备两类标识:

  • 显式标识:文字、图形、语音等用户可感知的提示,比如文本前后加「AI 生成」标签、视频角标
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
置顶

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
  • 隐式标识:元数据、水印等机器可读、用户不可感知的信息
  • Claude 的水印方案覆盖了后者,没有覆盖前者。也就是说,把 Claude 的 API 输出直接嵌入国内产品,隐式标识合规了,显式标识仍需要产品侧自己加。这是一个很容易被漏掉的合规缺口——技术团队看到「有水印」就以为齐活,等应用被约谈时才发现显式那半没做。

    再往下细看,隐式部分的合规也不是自动完成的。《办法》和配套的 GB/T 45438-2025 强制性国家标准要求隐式标识里带服务提供者名称或编码、内容编号、时间戳这类可追溯字段。锦标赛采样只嵌入了一个「是不是 AI 生成」的一位比特信号,不带来源、不带时间。要满足国标,还得在容器层(比如文件元数据、HTTP header、字幕轨)额外补一层结构化标识。这两层各自独立,缺一不合规。

    顺带聊一件容易忽略的时序:Anthropic 为什么等了近两年

    Google DeepMind 的 SynthID-Text 论文 2024 年 10 月发表在 Nature 上,Anthropic 落地是 2026 年 8 月,中间隔了将近 22 个月。厂商跟进一项已发表方法一般不会拖这么久,尤其是在监管催得这么紧的领域。中间发生了什么,Anthropic 没有公开细节,但从两个侧面可以推:一是 SynthID-Text 在 Gemini 上线后一年多里,学界陆续发表了针对它的对抗研究(同义改写、noise injection、Emoji smuggling 等),Anthropic 大概率在观望这些攻击面被摸清、跟进对策成熟之后才动手;二是 Anthropic 一贯强调「宁可晚一点,也不做仓促的安全承诺」,这跟它拒绝在 Claude 3 的推理链上做产品化露出、直到 4.5 才引入 extended thinking 的时序是一致的。

    对国内团队的启示是:不要看到国外厂商上了某个安全方案就急着跟。这类机制的成本不在训练侧、在治理侧——密钥管理、检测器发布节奏、误检投诉处理流程一样都少不了。Anthropic 用了 22 个月做的可能不只是技术验证,还包括这些非技术准备。跟风上一套水印却没配套流程,反而可能引来更麻烦的合规追问。

    给企业侧的一张实操清单

    综合上面这些技术边界和合规位面,给正在或即将部署 Claude API 的国内产品团队一张短清单:

    第一,别把水印当版权保护。它是「这段文字是 Claude 写的」概率信号,不是「这段文字属于谁」的所有权凭证。同一段 Claude 输出经过任何用户改写就可能失效,用它维权几乎不可能。

    第二,如果面向 EU 用户,水印能顶大部分合规压力。EU AI Act 只要求可机器检测,Anthropic 侧已经解决。产品侧要做的是保留原始输出、不做二次处理、准备好接受第三方审计。

    第三,如果面向中国用户,把标识办法拆成两条独立任务。隐式标识借 Claude 的水印是不够的——要按 GB/T 45438-2025 补服务方标识、内容 ID、时间戳;显式标识必须产品侧在渲染时明确加。别让工程和法务各自以为对方做了。

    第四,教育、招聘、内容审核这类高判定场景不要单独依赖水印。检测阴性不代表非 AI 生成(可能被去水印或翻译),检测阳性也不该作为唯一定性证据(密钥若泄露或误检率非零)。它是众多信号之一,不是判决书。

    第五,如果自研模型也要上水印,先想清楚阈值和密钥治理。阈值定太严会误伤自然文本的偶发相似,定太松则漏检严重;密钥必须按 CA 级别做多方托管和轮转。这两件事没想清楚就把方案上线,是给自己埋雷。

    Raschka 视频最后引到「从零构建」的教学价值上——不是学院派情怀,是判断这类新技术边界的必要能力。当一家厂商用「水印」这个直觉容易理解的词描述一套复杂的采样干预系统时,你不看到 g1、g2 那些函数、看不到候选池是怎么被抽出来的,就很难判断它到底能解决什么、又留下了哪些漏洞。这次 Claude 水印引发的争议里,大部分误解都源自把「加了水印」当成了「盖了钢印」,把概率工具当成了判定工具。理解机制,也就理解了它能承诺什么、不能承诺什么。

    350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
    置顶

    350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

    //

    24小时热榜

    华为鸿蒙7发布会:麒麟9050 Pro首发,Mate XT2三折叠展翼架构19999元起
    TOP1

    华为鸿蒙7发布会:麒麟9050 Pro首发,Mate XT2三折叠展翼架构19999元起

    Stuxnet源代码重建项目公开:史上最著名网络武器的攻击逻辑首次可读
    TOP2

    Stuxnet源代码重建项目公开:史上最著名网络武器的攻击逻辑首次可读

    3

    拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

    10小时前
    拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
    4

    微软 Azure Foundry 模型路由扩容至 28 区域,新增 Claude Opus 4.8 与 GPT-5.6

    1天前
    微软 Azure Foundry 模型路由扩容至 28 区域,新增 Claude Opus 4.8 与 GPT-5.6
    5

    《西雅图时报》与《新闻日报》起诉 OpenAI 和微软侵权,新闻版权诉讼持续蔓延

    1天前
    《西雅图时报》与《新闻日报》起诉 OpenAI 和微软侵权,新闻版权诉讼持续蔓延
    6

    理想汽车以 26.5 亿增资欣旺达动力,持股升至 11.17%,电池自研版图再进一步

    1天前
    理想汽车以 26.5 亿增资欣旺达动力,持股升至 11.17%,电池自研版图再进一步
    7

    NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

    1天前
    NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
    8

    微软向纽约时报诉讼提交 820 万条 Copilot 对话日志

    2天前
    微软向纽约时报诉讼提交 820 万条 Copilot 对话日志
    热门标签
    大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

    关注公众号

    前途科技微信公众号

    扫码关注,获取最新 AI 资讯

    免费获取 AI 落地指南

    3 步完成企业诊断,获取专属转型建议

    已有 200+ 企业完成诊断