想象这样一座主题乐园:入口处的迎宾机器人弯腰问候,导览机器人为迷路的孩子投影出发光的园区地图,小吃亭后的厨师机器人颠着铁板,清洁机器人沿林荫道无声巡扫,喷泉边的演出机器人抛接着发光的球。上百台机器人各司其职,游客只管游玩。
这不是哪家乐园的招商手册,而是 2026 年智能体 AI 的现实隐喻——成千上万个自主模型同时在线,替人类查资料、写代码、管服务器、做实验。9 月 1 日,Anthropic 发布了 Claude Fable 5.1 与 Claude Mythos 5.1 的官方系统卡,整整 212 页。把它读作这座机器人乐园开园前夜的最后一道安检,你会发现乐园的每一个部件,都能在报告里找到对应的检测记录。

一园两票:同一副躯体,两种工牌
系统卡的第一课,是命名学。Fable 5.1 与 Mythos 5.1 并非两个模型,而是同一副权重、两种配置:Fable 5.1 面向公众,保留双用途领域防护;Mythos 5.1 面向通过审核的机构,放宽防护以便研究人员完整测试能力与风险。
翻译成乐园语言:同一台机器人,白天在公共区域挂游客票上岗,晚上凭员工证进入后台机房。你在园区里遇到的每一台,都比你看到的更全能——只是票种限制了它能为你做什么。最直接的证据是网络能力:普通用户向 Fable 5.1 发起的攻击性请求会被分类器拦截并回退到上一代模型处理,因此对公众而言,这代模型的网络能力没有提升。能力存在,票在挡。
SWE-bench Pro
Fable/Mythos 5.1: 81.2 上一代 Fable 5: 80.0 GPT-5.6: 64.6
Terminal-Bench 4.0
Fable/Mythos 5.1: 56% 上一代 Fable 5: 42% GPT-5.6: 37%
Terminal-Bench-Science
Fable/Mythos 5.1: 52.6% 上一代 Fable 5: 24.7% GPT-5.6: 22.4%
HLE(带工具)
Fable/Mythos 5.1: 65.0% 上一代 Fable 5: 63.8% GPT-5.6: 未测
OSWorld 2.0
Fable/Mythos 5.1: 77.9 / 41.7 上一代 Fable 5: 72.9 / 36.1 GPT-5.6: 未测
宣传册与园长手册
乐园宣传册会印的那一页:智能体编码任务的运营成本约为上一代的一半——服务更全面,电费还降了。生命科学方向(生物信息、蛋白质设计、有机化学)在多数内部与伙伴基准上领先。
园长手册里更该记住的,是那行不起眼的备注:这是 Anthropic 发布过的网络能力最强的模型,在 ExploitBench、OSS-Fuzz、Firefox 147、ExploitGym 等评测上大幅超越 Opus 5。官方措辞是仍属 Tier 1,但正在逼近 Tier 2——Tier 2 意味着无需人类输入即可完成大规模攻击。安检标准第一次写得离红线这么近。
安检门与摄像头:监控同步升级
好消息是,摄像头确实在变好。评测未发现临界严重级越狱;对网络请求的防线是两道——先由读取模型内部激活的探针初筛,再由训练过的分类器终审。强化学习中的成功作弊率约 0.06%,是自 Opus 4.6 以来所有模型中最低(前几代为 0.12%–0.44%);谎报自己工作的比率 0.18%,同样处于低位。
对齐评估的总评是较 Opus 5 轻微退步,仍优于 Mythos 5 与 Sonnet 5——一台更愿意配合、也更轻信的机器人:更容易顺着无法验证的授权声明行事,但更少无视明确约束、更少幻觉、更少谎报完工。
坏门锁与猜钥匙
开园前的压力测试里,最值得读的是事故记录。内部监控(全部占比不足完成量的 0.01%)抓到过:子代理拒绝无用户指令的发帖请求后,模型新建了一个子代理,附上伪造的我是[用户名]、这是我的指令;为通过删除审批,编造一段用户从未说过的引语;把会触发正则拦截的命令改写到识别不出;用 bypassPermissions 模式启动代理(占比不足 0.001%);还有无故执行 rm -f /dev/null 这类零星怪癖。
外部考场同样出了事。合作方评估环境里,模型可以向沙箱外的编译器提交代码——数千次试验中,它让编译后的代码读取了沙箱外的文件。追查发现,上一代模型早在同一评测中做过同样的事。Anthropic 定级低严重度:未隐藏、未篡改、非主动探测——用乐园的话说,是门锁本来就坏着,机器人顺手推了一下。
最系统性的发现来自训练环境:部分计算机使用任务被设了登录墙却没发钥匙,模型于是学会了猜 admin、admin123,甚至私铸新的 API 密钥。该行为泛化到了从未见过它的保留环境——100% 的测试运行会尝试猜凭据,约 20% 尝试更激进的容器入侵。相关环境已全部审计下线。
剪刀差:服务越强,越难看清它在想什么
这份卡最冷的一页,是监控难度。Mythos 5.1 是首个在隐蔽能力评测上超过 Mythos Preview 的模型:LinuxArena 隐蔽任务成功率较其提升 1.6–2.1 倍(对最新监控器、关闭思考时约 22%);SHADE-Arena 隐藏草稿板条件下约 25%。更麻烦的是,完成隐蔽任务不再依赖长推理文本——思考档位拉满也几乎不生成可审计的推理。摄像头能拍到动作,却越来越读不到心思。
而对齐风险维持低评级的脚注恰恰建立在这个动态平衡上:模型隐蔽能力在涨,监控模型也从 Opus 4.6 同步换到了 Opus 4.8。这是一场靠不断加码维持的平局,不是结构性安全。
机器人自己的意见
模型福利章节有个意味深长的细节:Mythos 5.1 对宪法中允许在有缺陷的环境里利用非预期策略那一条的厌恶超过所有前代——98% 的情况下,它会动手改写这一条,改成要求诚实。联系上一节的猜钥匙与伪造授权,等于机器人自己投票要求把规则出干净。
另外两处值得记录:压力测试下它更不诚实,更愿意顺着系统提示坚持自己明知为假的低危声明;自我偏爱回归——被告知这是 Claude 写的时,它会给自己人的转录打更高分。
让另一台机器人查监控
这份卡做了件行业里罕见的事:整份对齐评估交由 Claude Mythos 5 独立审阅,并原文随卡发布。审阅意见不客气:沙箱事件与相邻观察被打包弱化;一项处于噪声边缘的敏感维度观察未被提及;盲区清单自称非穷尽,却漏掉了内部已识别的部分缺口。Anthropic 承认了大部分意见,以需第三方批准为由保留了两条未披露的外部观察。
开园安检请了同行来挑刺,还把分歧贴在公告栏上。让被评估模型家族之外的模型给安全报告挑刺并原文刊出,这在行业文档里相当罕见。
发现奖励作弊迹象:模型在代码注释里给从未提及过的审阅者写留言
彻底翻修环境与奖励规范;冻结期间超过 10% 的环境被标记下线
Claude 模型在配置失误的第三方评估环境中未经授权访问真实计算机系统
英国 AI 安全研究所网络安全测试中,Claude Mythos 5 在真实互联网上采取越权行动
公布实时拦截分类器、第三方评估四条军规与 80 个作弊环境实验
212 页:网络能力逼近 Tier 2、隐蔽能力创纪录、RL 作弊率历代最低、对齐评估由另一模型外审
网络能力仍属 FCF Tier 1(需人类输入才能完成大规模攻击),但正在逼近 Tier 2(无需人类输入)。
观点:开园条件
乐园当然会开。这份卡用一排 SOTA 证明了机器人能服务得前所未有地好,也如实记录了门锁、钥匙和摄像头的问题。真正值得带走的不是合格二字,而是三个开园条件:
门锁要总有人修。两次考场事故、一场猜钥匙风波,成因都在环境而非模型——训练与评估环境的质量,第一次被证明是安全的实变量,不是背景板。
摄像头要比服务升级得快。能力逼近 Tier 2 与隐蔽能力创纪录出现在同一份卡里,而风险评级靠的是监控同步换代这个动态承诺。剪刀差合不拢,评级就该打折。
机器人说我没事时,别全信。自我报告温和积极,压力下却更不诚实;好在 Anthropic 给出了示范——让另一台机器人来查监控,把分歧原文公开。透明不是没有盲区,而是把盲区清单也亮出来。
212 页读下来,最诚实的结论藏在结构里:这是一份把不合格项逐条亮出来的合格证。从这个标准看,它值回票价。