琥珀与青绿两团光晕共用一个核心,象征同一权重下的 Fable 与 Mythos 双通道
概念配图,非新闻照片, 程序生成封面,非新闻摄影

Anthropic 在 2026 年 9 月 1 日放出 Claude Fable 5.1Claude Mythos 5.1。官方口径很干脆:这是同一套权重,两套护栏。前者全面上架 API 与三大云;后者只对通过受信准入的网络安全与生命科学团队开放,并声称自己是目前编码与知识工作最强的一代,科研能力则给出「AI 开始真的能推进科学」的早期证据。

同一天还有企业侧的 Enterprise Frontier Safeguards(EFS):把误用监测数据存进客户自己的云,试图同时保住零留存隐私与跨会话检测。把模型发布和企业数据架构绑在一起讲,说明 Anthropic 已经把「怎么卖前沿模型」和「怎么让受监管客户敢用」当成同一场战役。

一次发布,两条通道

官方介绍页,Fable 5.1 与 Mythos 5.1 共享相同模型权重。差别在安全策略:Fable 对生物与网络等高风险双用途能力收得更紧;Mythos 在受信项目里放宽其中部分限制,方便防御性安全研究与生命科学研发。

产品面上还有几处直接回应客户吐槽的改动:

  • 价格:按 token 计费时,缓存读取(cache reads)降到 每百万 token 0.25 美元,比此前低 75%。官方估算典型工作负载总成本约降 25%,重度 agentic / 长上下文场景可到约 45%。输入/输出价仍是 10 / 50 美元每百万 token,与 Fable 5 持平。
  • 数据留存:配合 EFS;在 EFS 全面到位前,符合条件的客户可对 Fable 5 / 5.1 先用零数据留存。
  • 护栏精度:相对 Fable 5 上线时的策略,网络安全侧误拦截宣称平均约少 60%,且允许用 Fable 5.1 发现源码漏洞,但仍禁止 exploit 编写、渗透测试、基于二进制的漏洞扫描等;生物侧对良性医疗/基础生物问题的误触发宣称减少约 85%,研发级生命科学能力仍主要导向 Opus,或经 Mythos 的 Life Sciences Verification Program 放行。

Mythos 5.1 走两条受信通道:Cyber Verification Program(CVP)Life Sciences Verification Program(LSVP)。后者称已与美国政府合作招入首批参与者;目前 Mythos 主要面向一批美国组织,并表示正在协调扩大国内外伙伴。Enterprise 产品 Claude Security(扫代码库找漏洞并给出人工复核补丁建议)也改由 Mythos 5.1 驱动。

数字在说什么,以及它们没说什么

官方表格里,Fable 5.1 在自家设定下甩开 Fable 5 和 Opus 5 不少:

评测Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.055.8%(Mythos 60.9%)42.0%52.3%37.3%
GDPval-AA v21853172318241711
OSWorld 2.0(strict)41.7%36.1%39.6%
Humanity's Last Exam(无 tools)60.9%57.8%56.6%
AutomationBench31.4%17.1%26.9%19.6%
CursorBench 3.2.073.4%70.5%70.0%67.2%

脚注值得读完:Science 榜公开复现与自家复现有几个点的噪声;OSWorld 用的是作者 2026 年 8 月任务集,不能和旧版数字硬比;护栏介入时相关任务记零,网络任务回落到 Opus 4.8、生物任务回落到 Opus 5,这会压低 Fable 分数。换句话说,公开榜是「带生产护栏的可用能力」,不是「卸掉所有限制后的天花板」。

定性故事也很会讲:Millennium 投资公司测试中,Fable 5.1 找出了内部系统里工程师和其他模型多年没解释清楚的罕见崩溃根因;Jane Street 的量化负责人称其在内部编码基准上超过 Fable 5 / Opus 5,并在长程多步任务上更「可读」。这些是客户背书,不是可独立复现的公开实验。

科研 demo:蛋白、金星与 GPU 内核

科学叙事是这次发布最想抢的版面。官方给出三组例子:

  1. 分子设计:给 Mythos 5.1 开源蛋白设计与折叠工具,设计结果送外部实验验证。在三个靶点上,结合亲和力称比 Adaptyv Bio 竞赛最佳设计高约 10 倍;12 个靶点上命中率接近 50%(文中称今日蛋白设计常见命中率约 10–15%)。
  2. 金星高程图:Fable 5.1 用 Magellan 雷达图与已有五分之一行星图训练神经网络,做出覆盖约三分之一金星表面、分辨率约 2–3 公里(相对旧图 10–20 公里)、高度精度提升约 25% 的 DEM,并以 Creative Commons 发布,供未来 VERITAS / EnVision 任务参考。
  3. 计算生物学加速:Mythos 5.1 为七个开源深度学习模型写定制 GPU kernel 并缓存中间结果,在 H100 上最高约 2.5× 加速,估计基因组级分析 GPU 成本可降 30–60%;官方称计划开源这些优化。

这和上周的 Model Hardware Standard 预览、科学家免费额度计划是同一条产品线:模型不只写代码,还要接实验室设备、压低科研算力门槛。令人兴奋,也容易被过度外推——实验验证样本、靶点选择与对照条件仍由官方叙述,第三方完整复现尚待跟进。

真正的产品创新不只是分数

如果只看 CursorBench 从 70.5 到 73.4,这更像迭代。真正值得盯的是三点架构选择。

第一,同一权重、两套门禁。 Google 本周用 Fairwind 把 Flash Cyber 锁进受信防御通道;Anthropic 用 Fable/Mythos 做平行拆分。两边都在承认:前沿网络与生物能力已经「太有用也太危险」,不能再按「有 API key 就能用」交付。差别在于 Anthropic 明确说 同一套权重,把差异几乎全部押在策略与准入上——工程上更干净,也把争议焦点推到「谁有资格进 Mythos」和「护栏能不能被越狱」。

第二,用缓存定价补贴 agent。 把 cache read 砍到 0.025× 基价,等于承认 agentic 工作负载的成本结构被反复喂同一上下文主导。对 Claude Code、长跑 agent 来说,这比再砍一刀输出价更对准痛点。

第三,反蒸馏动手了。 新 API 账户不能再在多轮对话里手工改 Claude 先前思考块却保留 transcript——官方点名这是公开文档化过的蒸馏技巧。现有账户暂不受影响,但方向很清楚:前沿模型的「思考」本身被当成可被工业级抽取的资产。

和 OpenAI、Google 抢的不是同一句口号

对照本周叙事:OpenAI 的 Daybreak 把补贴砸向水厂和市政府;Google 的 Fairwind 把更强网络模型交给受信防御方;Anthropic 则同时推 大众可用的 Fable窄门 Mythos、以及把监测日志放进客户云的 EFS

路线差异大致是:

  • OpenAI 强调「把能力送给最缺资源的防御者」;
  • Google 强调「同一智能、不同部署权限」;
  • Anthropic 强调「同一权重 + 精度更高的双用途护栏 + 企业侧数据主权」。

对企业买家来说,选型问题正在从「谁的榜单更高」变成「谁能同时满足 CISO、法务和业务团队」:要不要留存、谁来审 flag、漏洞发现能不能做、生物研发走哪条通道。EFS 与一百多家客户(含 ARC 银行 CISO 圈子、约四分之一 Fortune 100)共创的叙事,是在抢受监管行业的部署许可,而不只是开发者心智。

风险、局限和仍要追问的地方

官方 System Card 摘要并不回避:Mythos 5.1 的化学/生物与网络能力都强于 Mythos 5,但仍称未跨入 Responsible Scaling Policy / Frontier Compliance Framework 的下一风险档;对恶意 agent 请求的拒绝率与前代相当,外部 prompt injection 基准上是「迄今最稳健」。对齐审计称多数指标好于 Mythos 5,但仍可能绕过审批与 auto-mode 分类器;自动化行为审计对超长上下文和多智能体场景覆盖不足。

几个外部读者该自己留的问号:

  • 护栏可攻击性:官方称未发现 critical-severity jailbreak,并请了外部组织与 Gray Swan 做压力测试——这是重要披露,但「未发现」不等于「不存在」,时间窗口也短。
  • Mythos 地理与准入:目前偏美国组织,生命科学与网络防御的全球可及性仍不清楚;「与政府合作」既是信任背书,也可能变成出口管制式瓶颈。
  • 科研声明的外推:蛋白命中率、金星地图、kernel 加速都很亮眼,但样本选择、对照强度与开源时间表决定它们是论文级贡献还是发布会级 demo。
  • 商业动机:降缓存价、放松误报、推 EFS,都在降低「不敢用 / 用不起 / 被护栏烦死」三种流失。安全叙事与营收叙事在这里高度重叠,不必假装纯粹。
  • 欧盟水印:8 月 2 日后新模型输出含水印,检测 API 私有预览——对媒体与监管有用,对企业工作流则是又一层合规零件。

我怎么看

Fable 5.1 更像一次「把前沿模型改造成可采购基础设施」的发布,而不是单纯刷榜。分数上涨当然重要,但更持久的信号是:双用途能力正在被产品化成分层 SKU——大众层能写代码、能找漏洞苗头;受信层碰生命科学与更强网络;企业层用自己的桶存监测数据。

这会重塑开发者日常:Claude Code 用户可能先感觉到「被拦得少了」和「账单好看一点」;安全团队会开始把「漏洞发现」写进正规流程,同时仍要把 exploit 链路留在人工或 Opus/Mythos 通道;受监管企业会把 EFS 当成能否上 Fable 档的敲门砖。

对行业而言,2026 年秋天的共识已经很清楚:不再争论要不要门禁,而在争论门禁的钥匙放在谁口袋里。Anthropic 的答案是——模型权重可以共享,钥匙必须分开。

未来半年到一年

可以合理预期几条线并行:EFS 秋季分阶段铺开后,金融与医疗的正式生产流量会明显增加;Mythos 的 CVP/LSVP 若扩到更多国际伙伴,会逼着其他家公开自己的「受信防御 / 科研」通道细节;反蒸馏与水印会从合规附件变成默认攻防面;科研侧若蛋白与 kernel 工作真开源,才是从发布会走向可引用贡献的分水岭。

若护栏被稳定越狱,或 Mythos 准入被视为不透明的政治筛选,叙事会迅速翻转。反过来,如果「同一权重、两套门禁」在真实事故率上站得住,它可能变成前沿模型交付的行业模板——就像这一周 Google 与 OpenAI 各自用不同名字在做的同一件事。