
八月十四日,Anthropic 发文解释 Claude 未来模型将如何给文本打水印;九月一日又补了一刀:检测 API 的私有预览范围写得更清楚。How Claude's text watermark works 读起来不像产品发布会,更像一份给监管、媒体和工程师同时看的说明书。
核心官方事实可以压成几句:方法基于 Google DeepMind 的 SynthID-Text 思路;不插隐藏字符、不涨 token、不贴用户身份;读者肉眼分不出;文件侧另用 C2PA 凭证。动机写得很硬——欧盟 AI 法案与行为准则要求标记 AI 生成内容,其他大厂也签了同一套规则。
[1]水印到底藏在哪
大模型每次选下一个词,常常在“阴天 / 灰蒙蒙”这类低利害近义词里掷骰子。水印把这枚骰子换成由密钥与前文共同决定的伪随机源:词仍从模型本来就会考虑的候选里出,但整段序列会与持有密钥者的期望分布对齐。检测端据此给出“Claude 参与过写作”的概率,而不是指出哪一次聊天、哪一个账号。
官方强调若干边界:水印不写用户 ID;轻度编辑未必洗干净,大幅改写或翻译可能削弱信号;检测 API 目前面向监管、执法、媒体、事实核查、独立研究、教育机构、欧盟公民社会,以及有合规义务的企业,属私有预览。图像等文件则附加 C2PA 元数据——那是标签,不是嵌入式水印。
[1]为什么偏偏选这条技术路线
作者判断:Anthropic 选 SynthID-Text 路线,是在“可检测性、质量无损、不可追溯到人”三者之间找交集。DeepMind 在 Gemini 流量上的对照显示点赞率无显著差异;人工并排评分也分不出。这对要过欧盟门槛的厂商很关键——既要可审计,又不能借机做用户指纹。
和“在文本里塞零宽字符”或“强制加注脚”相比,统计水印更难被普通读者察觉,也更难被一刀切的字符串过滤器干掉。代价是它证明的是参与度,不是版权归属,更不是内容真实性。
[1]谁会立刻用上
短期受益者是合规与平台治理:学校、媒体、监管可以用检测 API 做批量筛查。开发者与普通用户几乎无感——质量号称不变,费用号称不变。对企业采购,条款可能多一行:输出是否含水印、检测权限归谁。
竞争面上,水印会变成大模型的“同质化合规配件”。真正拉开差距的,是检测 API 的开放节奏、误报率,以及跨国场景下多厂商水印并存时如何解释冲突结果。
[1]评论员看法
我把这篇读成“证明参与,而不是证明作者”。标题党若写成“Claude 给每人打指纹”,就完全读反了。更值得警惕的是治理幻觉:有了水印,不代表虚假信息变少,只代表“是否像模型写的”多了一把尺子;人类仍可改写、拼接、翻译来稀释信号。
对 Anthropic 而言,九月一日的更新比八月原文更重要——它把检测权限画进欧盟义务与企业合规的圈子,而不是向所有人开放查重。这意味着水印首先是监管接口,其次才是公众工具。接下来六到十二个月,盯误报、盯跨厂商互认、盯编辑鲁棒性,比盯又一篇解释文更有用。
[1]