9 月 16 日挂出的一篇论文给出了一个反直觉的结论:SWE-bench Verified 排行榜的头部已经无法排序。论文《编码智能体已收敛:为什么 SWE-bench 排行榜不再能排列榜首条目》由 Fengshuo Liu、Ying Liu、Ruize Sun、Lie Luo 与 Siyuan Guo 合著,本周在 Hacker News 引发讨论,已被 ADMA 2026 的“负责任数据智能”特别分会接收。
[1]作者没有运行任何模型,而是审计了 254 份公开提交、四个 split 的逐实例判定矩阵。在 Verified 上,前两名各解决 500 个实例中的 396 个;前十名共享 285 个成功与 51 个失败,只有 164 个实例能区分它们的结果。前沿解集的嵌套系数为 0.935,而分数隐含的随机基线是 0.774——头部系统解决的是同一批问题。配对 McNemar 检验下,Verified 前三十名中 29 对相邻组合全部无法在 α=0.05 水平分离,最小的相邻 p 值为 0.545;更大的 Test split 则在 23 对中分离出 14 对。
[1]更棘手的是,分数不单属于模型。基于公开元数据重建的“模型×脚手架”设计显示,同一模型搭配不同脚手架,观测分数差最高达 29.8 个百分点,超过前三十名 8.8 个百分点的总差距;脚手架的相对排序还会随模型翻转。论文用三种描述性层级或 Holm 校正后的两种层级概括头部结果,并反复强调“不显著不等于等价”。内部一致性指标 KR-20 从全池的 0.994 一路降到前十名的 0.475——评测工具在区分头部系统时几乎失效。作者还估算了改进成本:要在配对设计下以 80% 功效分离相邻组合,约需 73.4 万实例;这个数字本身就是对现状最安静的控诉。
[1]作者据此提出五点审计协议:刻画共享结果、检验配对差异、报告分组敏感性、估算所需实例预算,并建议业界转而报告“针对比较集合的分辨率”与“模型-脚手架来源”,而不是把小差距读作确立的排名差异。
SWE-bench 曾是编码智能体竞争的主战场,模型厂商与采购方都引用它做宣传和选型。这篇论文的贡献不在提出新模型,而在于把“基准饱和”从直觉变成可复算的统计事实:当最好的系统解决同样的题目、失败的也同样是那些题目时,榜单上的名次更多反映噪声而非能力。论文同时提供了一个反证——Test split 依然能分离相邻组合,说明问题不在 SWE-bench 本身,而在头部区间的分辨率已经耗尽。对研究者来说,这或许是时候给排行榜换一种读法,或者为它补充更难、更新的题目。
[1]