夜班编辑桌:左右两块屏幕分别显示 ARC-AGI-3 标准线 62.7% 与 Provider Adapter 99.9%,中间一台被登山保护带捆住的服务器刀片
配图:同一套权重,两套脚手架,两张成绩单(AI 生成,非新闻照片), AI-generated illustration, not a news photograph

OpenAI 发布 GPT-6 Astra 时,最会飞的数字是 ARC-AGI-3 上的 99.9%。三天后回看,真正该钉在墙上的,其实是另一行:62.7%

这两行都来自造尺子的人。ARC Prize 在 9 月 3 日的博客里把两套跑法并排写清:Standard harness 在最大推理档给出 62.7%、花费约 26,098 美元;Provider Adapter 在 high 档给出 99.9%、约 18,817 美元。更好看的分数,跑起来还更便宜。

差别不在权重,在脚手架。标准线给所有模型同一套最小接口,笔记要不要留、留什么,模型自己写。OpenAI 的适配器会在请求之间保留不透明的推理状态,并用 compaction 压缩长对话——也就是把厂商为自己模型准备的上下文管理能力焊进评测。更扎眼的一行是:把推理努力调到 none,适配器里仍有 96.7%,比标准线满档还高出三十多个点。脚手架胜过了推理旋钮。

传播时用的对照更糙。满天飞的是 99.9% 对 GPT-5.6 Sol 的 7.8%。TNW 指出,前者走适配器,后者走标准线——那不是同一次考试。苹果对苹果该写 62.7% 对 7.8%:跃迁仍然巨大,只是没人会再把它念成「AGI 入场券」。ARC Prize 自己也拒绝了那句口号:明确写「not claiming that it is AGI」,Mike Knoop 说「we lack evidence to call this AGI yet」。往后排行榜会两套 harness 并排公示。

故事还没停在分数板。TNW 援引 Fortune 对发布页存档的比对:上线后至少五处指标被改过——Astra 幻觉率在 4.2% 与 2% 之间晃;Fable 5.1 的 FrontierMath 从 87.8% 掉到 78% 再停在 83%;Sol 的 ExploitBench 从 5.5% 翻到 11.5%(OpenAI 称在调查是否回滚,且 11.5% 对应的推理档并不对外卖)。禁运稿里的 ARC-AGI-3 还是 98.6%,上线稿写成 99.99%。斯坦福研究者 Anka Reuel 与 Mike Hardy 把这种反复重跑直到数字变好看的做法叫 benchmaxxing;系统卡里对内部幻觉基准「barely any details」。

我也不是说 Astra 没进步。标准线 62.7% 相对早期模型近乎零分,已经是台阶;适配器里动作效率还超过了人类中位基线。但产业正在把「模型」和「围绕模型的产品化脚手架」捆成同一个营销名词出售——Anthropic、Google、Microsoft 都在卖 harness,Nvidia 的脚手架甚至能把 Claude Opus 5 从 30.2% 推到通关。卖给你的是权重;刷屏的是系统。

独立指数也没给「新世代」留太多浪漫。Artificial Analysis 上 Astra 的 Intelligence Index 是 61,与被替换的上一代持平,落后 Fable 5.1;Coding Agent Index 67,被 Fable 5.1 的 70 压着。幻觉和长程知识工作有明显改善,但经济加权任务、银行客服、科学 Python、长上下文等项也有回退。口号越响,越需要把评测条件写进同一句话里。

判断:Astra 值得认真用,尤其在计算机使用与工程代理场景;但「欢迎来到 AGI 时代」如果靠的是未对齐的对照表,那更像发布会音响,不是科学结论。下次再看见一个接近满分的基准,先问三句:标准线是多少、适配器做了什么、对比模型是否同一套绳子。

[1][2]