微软和 Hugging Face 在 10 月 3 日发表联合文章。ThinkingBox 给智能体打分时看的是它留在后台的记录,不是它生成的句子,然后再问它能不能把同一件事连做 20 次。文章说,这套基准现在可以通过 Hugging Face 使用。一次工具调用格式正确,不等于事情做完了。

[1]
打开的服务器机柜里伸出一叠红色文件夹,前面放着一台打开的灰色笔记本。
红色文件夹还伸在机柜外面,笔记本摆在前面。对应记录没有收进要求的状态。这是插画,不是新闻照片。, AI 生成插画,不是新闻照片

文章举的例子是一台 745 美元的厨房电器,卡在纳什维尔配送中心的快递异常里,已经超过预计送达 15 天。智能体做了九次工具调用:查订单、查物流、看客户资料、查了两次退款政策、确认没有工单再开一张、写下时间线,也正确读出这个客户等级本来就没有延误赔偿。然后它把工单标成已解决。文章说有两处不对:承运异常还开着,要求的终态是挂起;顾客问的事也没有得到真正的答复。可执行检查失败在一个字段上:工单状态是 solved,要求的终态是 hold。

[1]

基准有 507 个有状态的业务流程,每个模型、每项任务跑 20 次,打分看的是最终的后台状态和副作用。一组共同消融覆盖 12 个模型的 121,680 次有效试验,其中 79,853 次没通过可执行检查。这些失败里,67.24% 仍然正常结束、调用了会改状态的工具、最后也没有报工具错误。检查却发现,77.61% 写错了字段,43.30% 多出了不该有的效果,25.36% 少了该有的效果。这三项有重叠,不是三份互不重叠的失败。

[1]

单次成功率最高的是 Claude Opus 5.5,总体 67.16%,Claude Opus 5 是 66.50%。两款在全部 20 次都通过的任务数相同,都是 241。文章说,这半个点的标题准确率没有多换来任何可靠性。Kimi-K3 至少做对一次的面最宽,但 507 项里只有 68 项、也就是 13.41%,是 20 次全部通过。GPT-6 Astra 保住了单次成功率的 78%,Opus 5.5 和 Opus 5 各保住 71%。另一端,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 大约只保住 8%。

[1]

费用是按 OpenRouter 上未打折的标价估算的,文章写明这不是账单。按单次成功算,GPT-5.6 Sol 最低,每次成功 0.127 美元。按 20 次都通过的任务算,GPT-5.4 是 6.80 美元一项,但只有 128 项达到;GPT-6 Astra 是 7.45 美元、231 项;Claude Opus 5.5 是 7.80 美元、241 项。失败标签里,工具使用占 79.9%。文章说这是各模型份额的未加权平均,不是唯一原因。文章建议先核对终态再提交,并写明这些做法带来的提升还没有在这个基准上测过。

[1]

要点

  • ThinkingBox 按数据库终态打分,每项任务跑 20 次。745 美元那个例子里,工单被标成已解决,要求的终态却是挂起。
  • 121,680 次试验里,很多没通过检查的尝试看起来仍然正常结束。Opus 5.5 单次 67.16%,和 Opus 5 一样只有 241 项是 20 次全过。
  • 可靠任务的估算费用和单次成功的费用不是同一列。工具使用占失败标签的 79.9%,是未加权平均。建议还没在这个基准上测过。