
GPT‑6 Astra 九月三日的发布博客,本身就上演了一出“先上线、再改数”。Fortune 对照多份存档快照发现:页面曾短暂撤回(公司先后归因 CMS 故障与网络中断),再发布后若干评测数字更偏向 Astra,且之后仍在变动。幻觉率一度从约 4.2% 降到 2%,随后又回到 4.2%;对前代 Sol 与对手 Fable 5.1 的部分数学分也曾上下挪动。
这不是又一篇复述 ARC 脚手架差距的稿——那条线已经有人写过。这里要盯的是:面向公众的计分板,在发布日下午仍可被无静改写。
[1][2]存档里动过哪些旋钮
据 Fortune 与后续 TNW 梳理:除幻觉率来回闪,Sol 的 ExploitBench 曾从约 5.5% 抬到 11.5%,OpenAI 表示可能回退,因为那一档推理能力并不对商业用户开放;媒体禁运稿里的 ARC‑AGI‑3 是 98.6%,线上后来写成 99.99%。并非每一次改动都抬高 Astra——部分 Anthropic 健康基准分也曾被调高——但整体观感是“分镜在对发布叙事让路”。
OpenAI 对 Fortune 的解释是:评测有噪声,取决于 checkpoint、脚手架与当次运行;发布更新是为了给出当时最好的可比估计。Stanford 研究者则指出系统卡对内部幻觉评测几乎不交代样本量等条件,并给这种做法一个难听的词:benchmaxxing。
[1][2]为什么“事后改数”比单一高分更伤
买家和投资人用发布页做采购与估值对照。若数字在归档快照之间漂移,对照本身失效。更麻烦的是与脚手架故事叠在一起:同一模型在标准 harness 与 Provider Adapter 上可以差出三十多个点,再叠加页面级修订,外界几乎无法知道自己到底在比较权重、脚手架还是文案版本。
Vincent Sunn Chen 一类从业者建议的规范很土:改了公开数字,就写明改了什么。土,但比“信任我们有噪声”可审计。
[1][2]对 2027 上市叙事的外溢
Silicon Report 等转述指出,评测漂移会让客户与投资人更难判断哪家模型适合哪类任务——而这正值 OpenAI 潜在 2027 IPO 窗口。竞争对手会把存档对比当攻击材料;采购合同可能开始要求“以系统卡冻结版本 + 第三方复现”代替博客截图。
[1][2]评论
我把这次快照对照读成信任税。实验室当然可以修正错误,但若不附变更日志,修正与粉饰在像素上无法区分。下一步该成为行业惯例的,不是更高的 headline 分数,而是每次改数的 diff:旧值、新值、原因、是否影响商业可用配置。做不到,Astra 的发布页就只是一份会呼吸的营销 PDF。
[1][2]