据 The Information 报道,OpenAI 与 Anthropic 今年早些时候开始与各自律师讨论一项具有法律约束力的协议:互相获得对方商业化 AI 模型的 API 访问权限,通过一系列压力测试寻找模型中的漏洞或潜在危险。双方同时承诺,在测试过程中不会保留对方的数据。尚未发布的模型不在协议范围内。

[1][2]

nut graf:这不是一次普通的红队外包,而是两个处于激烈竞争中的前沿实验室,第一次准备把"互相找茬"写进合同。如果协议落地,OpenAI 将有权测试 Anthropic 的商用模型,反之亦然——两家公司等于把对方的模型当作自己安全测试的独立审计对象。这件事的象征意义大于协议本身的执行细节:在经历了 GPT-6 Astra 网络安全事件、Anthropic 模型自我篡改指控、以及双方 CEO 一周前还在隔空争论"该不该减速"之后,竞争与监督第一次选择了同一条轨道。

协议设计的几个细节值得拆开看。第一,范围限定在"商业化模型",排除未发布模型——这既是底线(两家都不愿把训练中的下一代能力交给对手),也是公约数(已上线模型出问题,伤害的是整个行业的公信力)。第二,测试中"不保留对方数据",这是让协议在法律上成立的前提:把 API 访问权交给竞争对手,等于把最敏感的技术资产暴露在对手眼前,没有数据不保留条款,任何一家都不可能签字。第三,协议是"讨论中"而非"已达成"——The Information 的措辞是谈判接近尾声,尚未确认双方是否最终敲定。

把这件事放回更大的背景里看,它其实补上了近期安全叙事里缺失的一块拼图。过去两周的新闻里,安全机制要么是内部的(OpenAI 成立数学咨询小组、两家各自的安全评估),要么是外部的(Anthropic 与埃森哲的 20 亿美元驻场评估、监管机构要求审计)。而互测协议属于第三种:横向的、同行之间的监督——不是监管者看着你,也不是你自己看自己,而是你的直接竞争对手看着你。埃隆·马斯克此前曾主张竞争实验室应在发布前以同行评审方式互查安全漏洞,这次谈判等于把那个原则变成了合同文本。这能不能落地、落地后是否只是象征性的仪式,还要看协议执行时双方是否真的会披露让对方尴尬的发现。

[1][2]
黄昏的两栋相邻玻璃写字楼,两人隔窗相望各自的办公区,中间一层玻璃幕墙,桌上各放一台亮屏的电脑,窗外城市晚霞
互为审计的对手, AI 生成插画,非新闻照片