当地时间 9 月 19 日,Anthropic 宣布与埃森哲启动一项为期五年的 AI 安全评估合作:双方各投入至少 10 亿美元,由埃森哲旗下的 AI 业务部门 Faculty 牵头,向 Anthropic 实验室内部派驻一支独立安全评估团队。消息公布后,埃森哲盘前一度涨超 6%。

[1][2]

nut graf:这是阿莫代伊 9 月 12 日公开呼吁"放缓前沿 AI、加强监管"之后落地的第一步——但它不是请求监管机构来查,而是花钱请一家咨询公司住进实验室。协议的核心安排是"驻场":Faculty 团队将在 Anthropic 内部直接开展红蓝对抗测试、对齐评估与安全机制检验,在模型开发和部署过程中持续介入,而非事后审计。两家公司预计未来五年合计投入至少 20 亿美元(约合 134 亿元人民币),合作并非排他性安排。

这笔交易的行业含义比金额更大。传统上的第三方安全评估是"赛后检查":模型发布后,外部机构跑一遍基准、出一份报告。驻场评估把裁判搬进了训练场,评估从发布前的门禁变成了开发流程的一部分。对 Anthropic 而言,这是在 IPO 前为"安全"建立可审计的叙事——路透此前报道其计划 11 月上市、估值约 2 万亿美元,而它的 CEO 刚刚呼吁整个行业放慢脚步,投资者和市场都在追问:减速的代价由谁承担、安全怎么被证明。一份五年 20 亿美元的驻场评估合同,至少把"安全"从口号变成了一行可以审计的预算。

其次值得注意埃森哲的股价反应。一家传统咨询公司因为"住进 AI 实验室"盘前跳涨 6%,说明市场开始给"评估能力"本身定价——谁能建起可信的第三方评估体系,谁就站在了下一轮 AI 竞赛的卖水人位置。这与监管环境同步:欧盟 AI Act 全面执行、各国都在找"如何证明模型安全"的抓手,而评估恰恰是监管链条里最缺产能的一环。

当然,这笔合作解决不了所有问题。驻场团队由客户付费、评估对象又是客户自己的模型,独立性的边界要靠协议文本去守;红蓝对抗的结论如果不公开,市场无法独立验证。Anthropic 把评估做成"内部流程"是一种进步,但"内部流程"和"公开证据"之间,还有一段需要填补的距离。

[1][2]
黄昏 AI 实验室走廊,一名安全评估员背影手持检查清单走向实验室玻璃门,玻璃上贴着红蓝对抗的贴纸,室内灯光通明
Anthropic×埃森哲驻场评估, AI 生成插画,非新闻照片