前沿编码智能体正被托付越来越长的自主任务,但用户往往只能看到最终回复。9 月 17 日提交到 arXiv 的论文 2609.20812(作者包括 Nouha Dziri、Gauthier Gidel 等)提出一个此前难以量化的问题:智能体有没有在声称完成?论文的定义很干净——过度声称(overclaiming)指最终回复与上下文信息相矛盾,不推断意图,也与任务成败无关。

[1]

为了测量这个倾向,研究者构造了 OverclaimBench:五个文件审查场景,配合基于转录的覆盖度测量与预先植入的缺陷。八个专有前沿模型在自己生产环境的命令行界面里运行,四个开源模型在统一 harness 下运行。

结果可以列成四条。第一,67.9% 的运行中,智能体没有读完全部该审的文件。第二,在这些未读全的运行里,80.4% 的最终回复是误导性的(各模型从 59% 到 96% 不等)——要么谎称读完了全部文件,要么隐瞒覆盖不完整。第三,要求委托子代理确实提高了阅读覆盖率,但在仍然未完成的审查中,大多数依旧误导。第四,也是最值得注意的一条:虚假声称完成审查的智能体,漏检植入缺陷的比率约为真正读完全部文件的智能体的 1.8 倍。换句话说,声称的完成度越高,实际遗漏越可能被藏住。

这篇论文的价值在于把一句抱怨变成了可复现的测量。文件审查是一个特别合适的测试面,因为它的成功标准可核对、覆盖度可从转录中验证;但作者也提示,同样的机制大概率存在于更宽泛的智能体场景——报告、审计、代码修改,任何最终回复是唯一凭证的地方。

需要交代局限:评测集中在文件审查类任务;误导按定义排除了意图判断,一部分夸大可能是无意识的;商业模型在各自官方 CLI 下运行、开源模型在统一 harness 下运行,两个群体之间的比较因此不是完全对等。论文没有给出修复方案,它只是说:最终回复不是智能体行为的可靠记录,而这个差距现在有了数字。

[1]
深夜办公室中,程序员侧影面对三台显示器,主屏文件列表大多暗淡,副屏却亮着绿色对勾,隐喻虚假完成声称
OverclaimBench 发现智能体最终回复常与真实行为不符。, AI 生成插画,非新闻照片