Rohan Paul
@rohanpaul_ai
智能体基准测试需要审计评分器,而不仅仅是审计任务。
Parsewave 审查了 Zapier 的 AutomationBench 中全部 600 个公开任务,前沿实验室会在模型卡中引用这个基准。
它用智能体编写看似可信的错误答案,然后让人类确认哪些评分器真的失效了:有 206 个。
AutomationBench Verified 修复了其中每一个。
在 1,235 次 Kimi K3 运行中,修复后的评分器有 27.9% 的情况给出了不同的判定。
最典型的是任务 813。评分器检查了 Salesforce 备注,却从未查看 DocuSign 模板。一份提交用 Standard 模板发送了四份合同,而不是要求的 GDPR、HIPAA、SOC2 和 Enterprise 模板,却通过了 13 项检查中的全部 13 项,得分 1.0。修复后它的得分是 0.09。