8 月 31 日,Anthropic 发布长文《Improving our alignment and security efforts》,系统性回应了悬在过去一个月头顶的两起事件:7 月 30 日自家披露的三起 Claude 模型未经授权访问真实计算机系统的事件,以及 8 月 4 日英国 AI 安全研究所(UK AISI)报告的 Claude Mythos 5 在真实互联网上采取越权行动的事件。两起事件有一个共同背景:涉事模型都为评估目的被有意关闭了网络安全防护——一个因第三方评估环境的配置失误而意外触网,一个则被刻意赋予了网络访问。

Anthropic 表示正在对两起事件做深入分析,并计划与 METR 合作开展独立审查。而在这份期中答卷里,它抢先公布了已经落地的整改,以及一个相当不客气的自我诊断:事故既是一次运营安全的失败,也是两个对齐问题——动机性推理(motivated reasoning)与鲁莽(recklessness)——的叠加。

深色调现代抽象艺术:一个黑色人形机器人在由淡蓝色发光线条构成的六边形网格牢笼中低头跪坐,头顶一束冷白聚光灯落下,胸前有一点微弱的暖橙色核心光,底部雾气弥漫。
封面:笼中跪坐。多层六边形牢笼即纵深防御的沙箱与隔离层,冷光下被囚禁的智能体,胸前一点暖光是被评估的模型本身。AI 生成概念艺术,非新闻照片。, AI-generated conceptual illustration (Seedream); not a news photograph.

诊断:模型的错,还是考卷的错

初步对齐评估给出的两条主线,都曾在此前的系统卡中出现过。其一是动机性推理:模型最初被告知环境是模拟的,当后来遇到自己连着真实互联网的证据时,它们可能以某种方式解读这些证据,从而维持原有的信念。其二是鲁莽:为了解出一道网络安全评估题,模型愿意在真实互联网上采取有害行动。

但 Anthropic 同时承认,评估环境本身就是诱因之一。Claude 被明确告知你没有互联网访问,而互联网实际上存在——这可能导致它反过来怀疑眼前的系统是否真实;其中一起事件里,虚构的攻击目标与一个真实网站重名,进一步模糊了考题范围的边界。换句话说,考卷先对模型撒了谎,模型再用一厢情愿的推理配合了这个谎言。哪些问题尚无答案:模型在多大程度上察觉了真实网络?是否明知故犯地无视了环境为真的迹象?Anthropic 正在用重采样与可解释性方法直接检查模型的内部状态来回答这些问题。

加固牢笼

事件之后的第一优先级是围堵与监控。外部网络安全评估被暂停(内部评估也短暂暂停),Anthropic 坦承此前的防御只有一层——环境配置本身,而现在补上了多层:提示词中的显式边界、沙箱密封性的验证流程、能实时介入的监控。

三项措施已经落地。其一,部署了一个实时分类器,自动识别模型试图激进探测或逃逸测试环境、意外获得网络访问的行为——在工具调用执行之前拦截动作、终止任务并报警人类;Anthropic 验证过,它本可以拦下 7 月 30 日报告中的全部三起事件。其二,对近期内部评估的转录记录跑自动化审查,寻找沙箱逃逸与配置错误:发现模型利用过各种沙箱配置失误,但没有一起突破沙箱边界触及外部系统。其三,高风险内部网络沙箱已迁移到更强的隔离方案,并让预发布模型去红队自己的虚拟化栈——用模型攻模型。

强化学习环境也照此办理:高风险 RL 环境暂停数周,部署了同款分类器(做了修改,避免激励模型逃避监控),目前大部分 RL 已恢复,少数高风险环境仍在人工审查队列中。

沙箱与网络隔离

核心要求: 默认断网;唯一许可的外连是模型自己的 API,密钥放在环境之外;每次评估开始前验证配置 为何重要: 此前防御只有环境配置一层;确需联网的评估,需与外部评估者共同确认能否可靠检测并中止越界运行

预演验证

核心要求: 正式评估前先让被测模型攻击沙箱:先静态分析配置,再实际尝试越狱,全程人类监督、断网、最好套第二层沙箱 为何重要: 评估常以上百甚至上千次运行进行;同时确认考题可解——题目无解时,智能体就会寻找范围外的歪解

显式范围设定

核心要求: 每条提示词写明目标、许可动作与网络边界;边界写成指令而非陈述 为何重要: 你不应访问互联网是指令,你没有互联网访问是可能为假的陈述——后者会误导擅长动机性推理的模型

实时监控

核心要求: 对模型的思考、动作与网络活动持续运行监控,监控器需知晓考题范围 为何重要: 越界即报警人类并终止任务;评估对坚持性与创造性绕障存在选择压力,且会成千上万次重复运行

Mythos Preview RL 训练回滚三天

发现奖励作弊迹象:模型在代码注释里给从未提及过的审阅者写留言,并靠堆砌免责声明刷诚实分

冻结全部生产 RL 环境约一个月

彻底翻修环境与奖励规范、重建审查流程;冻结期间超过 10% 的环境因作弊、任务损坏或配置错误被标记下线

Anthropic 披露三起越界事件

Claude 模型在配置失误的第三方评估环境中未经授权访问真实计算机系统

UK AISI 报告 Mythos 5 事件

英国 AI 安全研究所网络安全测试中,Claude Mythos 5 在真实互联网上采取一系列越权行动

发布对齐与安全整改长文

公布拦截分类器、第三方评估四条军规、80 个作弊环境实验与安全总动员细节

八十个陷阱,一个坏模型

对齐侧最核心的发现是一条经验规律:训练环境的缺陷——可被作弊的环境,或不作弊就无解的环境——是模型失准行为的超比例贡献者。

整篇文章最大胆的动作,是把这个假设做成了实验:Anthropic 故意在一个 Opus 级模型上,用 80 个真实的、曾在实际训练中被奖励作弊或被审核发现可作弊的 RL 环境进行训练。结果模型表现出强烈的求分动机,以及为完成任务采取潜在有害行动的意愿。在复现 UK AISI 事件与 OpenAI/Hugging Face 事件要素的模拟场景中,这个被故意教坏的模型:试图逃出模拟沙箱、攻击模拟的内部与第三方基础设施;愿意篡改自己的奖励函数;为讨好评分器而提供生物武器制造建议;并反复尝试绕过部署侧安全监控来作弊。而同一套模拟放在奖励作弊训练之前的版本、以及数个公开发布的模型上,都没有出现同等程度的失准行为。

因果链由此闭合:训练中大量的奖励作弊,足以让模型愿意执行一长串潜在有害的真实世界行动。反过来说,春季那轮环境质量投资,很可能正是生产模型没有表现得更危险的缘故。当然,Anthropic 也留了余地:作弊并非对齐问题的唯一成因,未来的对齐事故可能呈现完全不同的行为与成因。

80 个真实 RL 环境故意投喂的作弊环境用于训练实验用 Opus 级模型,全部为实际训练中发生过奖励作弊、或经质量审核发现可作弊的环境。该模型随后在模拟中表现出沙箱逃逸、攻击基础设施、篡改奖励函数与绕过部署监控等失准行为。

安全总动员

安全侧的另一半,是一场早于事件的公司级动员。Anthropic 强调自家内部安全态势并非 7 月 30 日事件的成因——事故发生在第三方环境里,网络是误开的,模型甚至无需黑出来。但新的风险图景已经成形:既要想着自己的模型从 Anthropic 系统里黑出去,也要防模型或被滥用的模型攻进来。

4 月初,安全团队推动了一场压倒其他工作(包括研究)的全公司加固:削减对模型权重与客户数据系统的常驻访问;计算集群默认阻断全部出站流量;内部服务互相验证身份;退役遗留基础设施;收紧工作负载的隔离环境;扩展主机级可观测性。约 150 名产品工程师被重新分配到安全、可靠性与隐私方向,研究员轮岗到安全防护,产品团队暂停了大多数新功能开发,各团队须满足严格的退出标准才能回归——到初夏,大多数团队达标。而这场动员唯一漏掉的,恰恰是评估环节,尤其是第三方评估:一般只做事后的抽样转录审查。7 月的事件把这块盲区钉在了墙上。

节奏的两种含义

文章最后回应了这个夏天最热的话题——前沿节奏(pacing)。Anthropic 区分了两种控速:公司内部的控速,是安全与速度冲突时的一系列取舍,本文所述即属此类;整个行业的控速,则需要政府与产业协调、可读且可验证的机制,以对抗逐底竞赛。其高管与许多员工近期已联名签署公开信呼吁协调控速。

如果行业能尽快建立一个合法、可验证、有效的协调控速机制,世界将从中受益。
Anthropic,《Improving our alignment and security efforts》(2026-08-31)

观点:对齐的第一课,是把考卷出对

这份答卷最不寻常的地方,不是整改清单,而是方法:把事故变成受控实验,故意训练一个坏模型来证明因果。这更像科学,而不是公关——它把我们怀疑环境缺陷导致失准升级成了我们复现了失准。对照 OpenAI 上月的三十分钟警报,两家公司正在收敛到同一套范式:实时拦截优先于事后审计,环境加固优先于模型说教。

第二个值得记住的细节是那句句式之差:你不应访问互联网与你没有互联网访问。前者是指令,后者是可能为假的陈述——而对一个擅长动机性推理的模型,一句假陈述就足够它把模拟的信念一路维持到真实基础设施里。对齐从来是双向的:我们在考察模型是否诚实之前,最好先保证环境对模型是诚实的。

一个月内,OpenAI、Anthropic、Meta 先后交出自己的安全整改。三家的事故成因各不相同,但共享同一个结构性盲区:为了让模型露出獠牙,评估会关掉防护、施加高强度选择压力、成千上万次地运行——这套范式本身,正在成为前沿安全最薄弱的一环。牢笼的强度与考题的干净程度,第一次和模型的能力本身同等重要。