Anthropic 在 2026 年 9 月 28 日发布 Claude Sonnet 5.5,称它是 Claude 5.5 系列里的第二个模型。页面写明,它相对 Claude Sonnet 5 是一次明确升级,运行快 30% 以上,对多数工作的费用最多低 30%。

它被放在 Claude Opus 5.5 旁边,定位是更快、更低成本的补充。Opus 5.5 面向需要仔细判断的复杂工作。Sonnet 5.5 被说成最强的地方,是范围清楚的日常任务、修 bug,以及做出已经整理过的文档、幻灯片和表格。页面还写,它对设计看得比较准。Claude Haiku 5.5 被描述为面向高调用量和成本敏感的应用,将在未来数周加入这个系列。页面没有给 Haiku 的日期。

[1]
水彩:小纸已经涂完,旁边的大纸只涂了一半。
小纸画完,大纸停在湿边。它对应范围清楚的任务已经做完,开放式的工作仍留着。这是插画,不是发布会照片。, AI 生成插画,不是新闻照片

代理编码评测 Terminal-Bench 4.0 上,Sonnet 5.5 是 70.6%,Sonnet 5 是 10.3%。同一张表里,Opus 5.5 是 66.4%。脚注写明,Opus 的这个分数取的是 Xhigh,也就是该模型报出的最高分。因此这不是同一档努力程度的并排。

知识工作 GDPval-AA 上,页面说 Sonnet 5.5 比 Opus 5.5 低两个点。表里的顺序是 Sonnet 5.5、Sonnet 5、Opus 5.5,数字为 1844、1449、1846。脚注 3 说,Artificial Analysis 是在 Claude Platform 的预发布部署上跑的 GDPval-AA 和 AA-Briefcase。Anthropic 发现那个部署有一个 bug,可能让使用结构化输出的请求变差。公司预期这个影响如果有,也会很小,并且是低估成绩。bug 后来已经修好。本篇不采用表上的 GPT 对照。脚注 4 说其中一些对照可能还没更新到模型的最新版本。

电脑使用 OSWorld 2.1 的表写的是 partial:Sonnet 5.5 为 80.1%,Sonnet 5 为 57.0%,Opus 5.5 为 81.8%。页面另写,它是第一个只看截图就打过 Pokémon Red 的 Sonnet。

公司同时写明,基准只抓住能力的一面。在自己的测试里,以及外部测试者的测试里,需要持续判断的复杂、开放式工作,仍然是 Opus 5.5 明显更强。

[1]

价格和 Sonnet 5 相同:每百万输入 token 2 美元,每百万输出 token 10 美元,缓存读取每百万 token 0.20 美元。页面说它做同样的工作通常需要少得多的 token。在公司自己的测试里,每项任务最多比前代便宜 30%。输出生成比 Sonnet 5 快 30% 以上,被写成迄今最快的 Sonnet。

网络安全能力被说成与 Opus 5 相当,注意不是 Opus 5.5。因此这是第一个带着网络防护和回退上线的 Sonnet,做法类似公司给能力更强的模型准备的那一套。用户仍可以在常规软件开发里找 bug、修 bug。更高风险的网络安全任务会明显回退到 Sonnet 5。生物防护与 Sonnet 5 相同。两类防护针对的是一小撮高风险请求。常规软件开发和大多数生命科学工作不受影响。

在公司大约 1850 个场景的自动行为审计里,Sonnet 5.5 在对齐、抵制滥用和诚实的大多数指标上优于或持平 Sonnet 5。页面也写,没有任何一组评测能可靠抓住每一次失败,Sonnet 5.5 可能还有他们没发现的倾向。

和 Opus 5.5、Sonnet 5 一样,Sonnet 5.5 提供零数据保留。它已经在所有平台可用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。Claude Platform 上的模型名是 claude-sonnet-5-5。如果现在把 Sonnet 的思考关掉,迁到 5.5 之前要改成 between_tools。这个设置保持事先思考关闭。

[1]

页面没有把 Sonnet 5.5 写成全面超过 Opus 5.5。Terminal-Bench 上高于 66.4% 的那一格,对照的是 Opus 的最高努力档。GDPval-AA 和 AA-Briefcase 的分数来自结构化输出 bug 修好之前的预发布部署,公司认为这会低估成绩,但本篇没有复跑。早期测试者的引语和系统卡本篇都没有采用。

[1]

要点

  • Sonnet 5.5 比 Sonnet 5 快 30% 以上,多数工作的费用最多低 30%,标价不变。
  • Terminal-Bench 4.0 为 70.6% 对 10.3%;表内 Opus 5.5 的 66.4% 取自最高努力档。
  • GDPval-AA 低 Opus 两个点。预发布部署的结构化输出 bug 已按页面说法修好,分数可能被低估。
  • 更高风险的网络安全任务会回退到 Sonnet 5。Haiku 5.5 只有「未来数周」,没有日期。