9 月 17 日提交到 arXiv 的预印本《How Do Agent Harnesses Create Value?》(2609.20474,作者 Yukun Zhang、Kemu Xu、Yishen Chen)试图回答一个 agent 工程里被反复争论却少有人实证的问题:一个智能体外围的"挂具"(harness)——规划指导、执行组织、完成检查——到底值多少钱?答案是:值多少取决于你给"错误接受"定多高的价。
方法相当干净。研究在 τ²-bench 的两个 Retail 实验与一个 Airline pilot 中进行,核心对照是"预写任务特定计划(Fixed)"与"词数匹配但打乱顺序的策略文本(Sham)",以此隔离指导内容本身的贡献,而不是框架的贡献。在 265 个匹配单元上,Fixed 将 oracle 验证的成功率提升 7.17 个百分点(90% 任务聚类 bootstrap 区间 1.15–13.36),增益集中在复杂度更高的任务上。7.17 个百分点在 agent 评测里不算小,但注意那个区间——下限只有 1.15,说明效果在部分任务上并不稳定。
验证器部分更有意思。一个只读终端验证器(read-only terminal verifier)拒绝了 61% 的 Retail oracle 无效 episode,同时误伤(withhold)了 17% 的正确 episode,每个 episode 的额外成本不到 1 美分。这两个数字放在一起,价
[1]值判断就出现了:验证器便宜、能拦下大部分坏结果,但它也会挡掉一些好结果——"宁可错杀"与"宁放过"的权衡,取决于产品把错误接受当成多严重的责任。
论文最尖锐的结论在这里:哪个组件更关键,取决于错误接受损失的赋值。在低责任场景(比如内部研究工具),规划带来的增益占主导;在高责任场景(比如面向客户、会产生下游费用的 agent),验证器避免的假通过(false passes)占主导——而且一个独立验证器就能以一小部分成本捕获完整"规划+验证"栈几乎全部的假通过收益。翻译成人话:如果你怕的不是"做不成",而是"做错了还假装做成",那验证器比任何规划提示都值钱。
局限要交代清楚。这是单基准(τ²-bench)上的模拟环境实验,oracle 验证本身是人工设计的近似;90% 置信区间较宽,Airline pilot 规模有限;"错误接受"的损失赋值是作者设定的场景参数,换一个行业它可能倒过来。论文没有声称"规划无用",它声称的是:当假通过的成本高到一定程度,检查完成这件事的价值会超过规划本身——这是一个可以用成本函数检验、而不是用口号检验的判断。
对正在大规模部署 agent 的团队,这篇论文提供了一个可操作的审计框架:先把"错误接受一次要损失多少钱"写进成本模型,再决定钱应该花在更好的规划上,还是花在一个便宜的只读验证器上。大多数团队会把预算花在 prompt 上;这篇论文给出的证据指向相反的方向。
[1]