
八月十四日,Anthropic 在新闻室挂出一篇不怎么像产品发布、更像 FAQ 的长文:How Claude’s text watermark works。九月一日又补了一刀:水印检测 API 进入面向合规主体的私有预览。读完会发现,真正的动作并不在「加个看不见的标记」本身,而在欧盟 AI 法案透明度义务生效之后,头部模型厂如何把「可机读、可检测」写进采样链路——以及它故意不承诺什么。
Claude 到底在水印什么
官方交代得很直白。未来 Claude 模型生成的文本会带统计水印,用来估计「这段文字有多大概率经过 Claude 参与」。动机写得很硬:Anthropic 与多家主要 AI 提供商签署了欧盟《AI 生成内容透明度行为准则》,自 2026 年 8 月 2 日起,面向欧盟市场的生成式 AI 需要以机读方式标记 AI 生成内容。公司选择全球同步开启,理由是「还没有耐久的区域分流方案」;是否改为分区策略,官方说会继续评估。
技术路径不是在文本里塞隐藏字符,也不是加额外 token。大模型本来就在近义词之间掷骰子——「今天天气又冷又……」后面选 overcast 还是 grey,对读者几乎无感。水印把这类低风险选择的随机源,从任意 RNG 换成「密钥 + 前文若干词」决定的伪随机过程。读者看不出差别,但持有密钥的人可以检验整段词序列是否与该密钥下的选择一致,从而给出概率判断。
Anthropic 明确采用 Google DeepMind 在 2024 年 Nature 论文中提出的 SynthID-Text 思路,谱系可追溯到 Scott Aaronson 2022 年的提议。内部测试称对内容、创意与可读性无明显影响;他们还引用 SynthID-Text 原论文:DeepMind 在 Gemini 流量上做 A/B,拇指好评差异无统计显著性,人类并排盲测也看不出质量差。
检测能力有边界,官方自己写得很清楚:水印回答的是「Claude 是否可能参与过」,不能证明「完全由人类写」或「由别的 AI 写」;短文本置信度低,越长越稳;事实密集段落与严格校对场景可选择空间小,水印更稀疏;代码里必须精确的 token 基本不打水印,注释等任意命名处可以;全文改写可抹掉信号,轻度编辑通常不行。文件类输出则走另一条路:对支持的 png、jpg、svg 附加 C2PA Content Credentials——密码学签名的元数据声明,而不是嵌入像素的水印。
对用户侧的关键声明还包括:不减速、不加价;水印不含用户、组织或会话标识;检测 API 目前只对欧盟法定义务相关的机构(监管、执法、媒体、核查、研究、教育、公民社会等)及有合规需要的企业开放私有预览,并计划扩大。2026 年 8 月 2 日前上线的旧模型有过渡期,水印会在未来数月补齐。
它真正改写的产品假设
水印听起来像合规补丁,实际动的是生成链路的随机性契约。过去几年,行业习惯把「采样」当成纯工程旋钮:temperature、top-p、seed。SynthID 式水印等于告诉开发者:在意义等价的候选集合里,随机源可以成为公共品——它不改变你读到的语义,却改变事后可验证性。
对开发者,短期几乎无感:延迟与计费不变,输出肉眼不可辨。真正要改的是产品叙事与合规清单——尤其是面向欧盟的写作助手、客服、营销生成器。你不能再把「我们没有隐藏字符」当成透明度的全部;审计方会问:有没有机读标记?检测接口给谁?短文本与重度编辑后的漏检怎么办?
对企业采购,水印是弱承诺、强信号。弱,是因为它证明不了作者权、所有权,也挡不住完整改写;强,是因为它把「是否经过某家 frontier 模型」从语言学猜测(AI detector 抓句式癖好)推进到持钥方可复验的统计检验。媒体、教育、平台治理会更喜欢后者,即便两者都会误伤。
对普通用户,最大变化可能不是写作体验,而是社会预期:当你把 Claude 译文、长邮件、报告整段粘贴出去,持钥方未来或许能给出「参与概率」。这不等于被「实名追踪」——官方强调水印不可追溯到人——但会改写「匿名 AI 代笔」的默契。
三条路线,同一张合规试卷
把 Claude 的选择放到 2026 年夏秋的行业地图上,反差很清楚。
Google DeepMind 最早把 SynthID-Text 推到生产并公开论文,等于把方法本身变成半公共基础设施。Anthropic 选择直接站上这条已验证的技术栈,用 FAQ 把局限写穿,再用检测 API 的白名单回应「谁有权验」。这是「借用公开方法 + 自管密钥 + 合规优先全球开」的组合。
OpenAI 的公开 provenance 文档目前更强调图像与音频:支持的图片可带 C2PA 与 SynthID,音频可带不可闻 SynthID;文本侧长期研究过统计水印,但面向普通 ChatGPT 文本是否已全球默认启用,公开材料并未给出与 Anthropic 同级的「已对未来模型强制开启」声明。OpenAI 帮助中心写明目标是把 provenance 扩展到包括文本在内的全部模态,以配合欧盟透明度行为准则——节奏与 Anthropic「先全球开文本水印」并不一样。
这不是谁更道德的竞赛,而是产品哲学分叉:Anthropic 用全球统一行为换取合规简单性与品牌叙事;OpenAI 更像按模态逐步铺 provenance,文本仍是敏感缺口。对监管者,统一机读标准尚未形成——各家密钥不同、方法也可能不同,跨模型「这是不是 AI」仍然拼图。对攻击者与规避者,已有公开研究讨论释义、回译等对 SynthID-Text 类方案的削弱;Anthropic 自己也承认彻底重写即可去掉信号。水印因此更像合规地板,而不是反滥用天花板。
别把概率当成铁证
需要严格分层。
官方事实:水印改变的是低风险词选择的随机源;不含用户身份;检测给出的是参与概率;文件走 C2PA 元数据;旧模型有过渡期;检测 API 现阶段不是面向所有公众的「一键验真」。
第三方信息:SynthID-Text 的质量影响评估主要来自 DeepMind 原论文与 Anthropic 自述的内部测试;关于释义攻击、低成本抹除的讨论存在于公开研究与行业评论中,但并不构成对 Claude 具体部署参数的独立红队报告。本文未看到 Anthropic 公布检测的精确假阳性/假阴性曲线或对抗鲁棒性数字。
作者判断:最大误用风险不在技术,而在制度挪用——把「水印阳性」当成学术不端或造假的充分条件,或把「水印阴性」当成人类原创证明。短文本、事实段落、轻度 AI 润色,本来就容易落在检测灰区。另一层争议是全球开启:欧盟义务被放大成全球默认,有利于运维,却也可能在其他司法辖区触发「强制标记」的政策外溢,而用户未必知情。
商业动机同样好读。水印本身几乎零边际成本,却能在企业销售与监管沟通里变成可勾选的透明度条目;检测 API 的准入名单,则把「验真权」收束在国家与大型机构一侧,短期内强化了平台对证据链的控制,而不是把验真民主化给每个读者。
我怎么看
这篇 FAQ 最值得赞的地方,是 Anthropic 罕见地用大量篇幅写「水印证明不了什么」。在宣传本能通常会夸大溯源能力的行业里,主动收窄主张,反而是更耐用的公关。它也坦然承认:自己站在 DeepMind 的方法肩膀上,而不是再发明一种私有玄学。
我担心的是下一步社会用法。一旦媒体与学校把检测 API 当尚方宝剑,灰区案件会先砸向学生、自由职业写作者和翻译工作者——恰恰是水印信号最不稳定的使用场景。更健康的制度设计,应把水印当作「需要解释的线索」,与过程留痕、引用规范、人类贡献声明并列,而不是一元判官。
与 OpenAI、Google 的对照也说明:透明度正在从模型卡上的段落,变成采样与文件封装里的默认行为。接下来比拼的不是谁的水印更「隐形」,而是谁敢公开检测误差、对抗测试与区域策略,以及谁愿意让独立研究者复现验真——而不是只给执法与大客户一把钥匙。
六到十二个月看什么
三件事决定这篇 FAQ 会不会变成行业底噪。一是检测 API 是否从私有预览扩到更广的研究与平台接入,并给出可核对的误差说明。二是 8 月 2 日前旧模型的补水印是否如期完成,避免「新旧两套真实性」。三是欧盟及其他辖区是否推动跨厂商互操作——否则每家一把钥匙,平台治理成本会指数上升。
若文本水印停留在「合规已打勾」,它改变不了滥用与深度伪造的主战场;若它逼出可审计的验真接口与公开对抗评估,才会真正把透明度从口号推进到基础设施。骰子还在滚,只是有人换成了 π。