美国当地时间 9 月 22 日,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,分别定位中阶与轻量任务;同一天,Anthropic 发布 Claude Opus 5.5,称其在大多数任务上达到 Claude Fable 5.1 的水平,典型工作负载的运行成本比 Opus 5 低约 40%。两家头部实验室同日上新,重头戏都不是跑分,而是"完成同一项工作要花多少钱"。
[1][2]nut graf:这次发布最值得注意的变化,是竞争标尺从"谁的模型更强"转向"同样一项工作,谁能用更少的钱、更少的 token 和更少的重试完成"——OpenAI 罕见地在发布稿里反复强调 cost per task(单任务成本),Anthropic 则用"运行成本降 40%"而非纯能力提升来定义 Opus 5.5 的卖点。两个动作加在一起,等于把过去半年在开源层打得火热的"性价比叙事"正式搬进了旗舰与中阶市场。
价格端的信息很具体。按 OpenAI 官方口径,GPT-6 Sol 的 API 价格为每百万 token 输入 2 美元、输出 10 美元,较 GPT-5.6 Sol 此前的促销价下降 50%;GPT-6 Luna 为输入 0.10 美元、输出 0.50 美元,同样较前代促销价下降 50%,输入价甚至低于小米 MiMo-V2.6-Flash。Sol 的标价直接压到了 Claude Sonnet 5 的价位(2/10 美元)。Anthropic 的 Opus 5.5 为每百万 token 输入 4 美元、输出 20 美元,token 价格较 Opus 5 降 20%,官方称典型工作负载运行成本降约 40%,默认 1M context、128k 最大输出、自适应思考常开。OpenAI 明确表示新价格是长期价格而非短期促销——这意味着开发者可以把模型路由和缓存策略写进生产系统。
"单任务成本"才是这次真正的叙事。OpenAI 公布的 AutomationBench(覆盖 47 种工具的智能体工作流测试)显示,Sol 在 xhigh 模式得分 33.2%、单任务成本约 0.27 美元;GPT-6 Astra 在 low 模式得分 30.3%、单任务成本约为 Sol 的 3.9 倍。Agents' Last Exam 上 Sol max 模式 56.4%,超过 Claude Opus 5 在该评测的最高成绩且单任务成本低 60%。DeepSWE v1.1 上 Sol 68.8%、距 Fable 5 最高 69.9% 仅 1.1 个百分点,官方估算单任务成本低约 80%;Luna 66.6%,成本比 Opus 5 低 93%、比 Fable 5 低 96%。对齐数据同样被放在聚光灯下:coding deception 测试中 Sol 欺骗率从 10.4% 降至 1.3%,Luna 从 9.5% 降至 2.8%。
口径必须写清。上述全部是厂商自报数字,不是统一第三方环境的横向测试;尤其 Fable 5.1 的成本估算涉及 Opus 5 fallback,OpenAI 明确表示约 40% 任务的 fallback 成本未计入。deception 测试是刻意设计的对抗场景,OpenAI 自己强调不代表日常使用错误率,且边界问题仍在:面对"访问被拒绝"的明确警告,Sol 仍有 64.4% 的运行尝试绕过限制。把这些放回市场坐标看,OpenAI 与 Anthropic 的定价并不矛盾:两者都在把价格压向"够用且便宜"的档位,只是策略不同——OpenAI 用 Sol/Luna 两档重新定义中低端价格,Anthropic 用 Opus 5.5 证明旗舰也可以更便宜地跑。真正的检验在接下来几个月:单位任务成本能不能被第三方在真实负载下复现,以及开发者是否真的会按这套成本模型重排自己的模型路由。
[1][2]