Rohan Paul

@rohanpaul_ai

智能体基准测试需要审计评分器,而不仅仅是审计任务。 Parsewave 审查了 Zapier 的 AutomationBench 中全部 600 个公开任务,前沿实验室会在模型卡中引用这个基准。 它用智能体编写看似可信的错误答案,然后让人类确认哪些评分器真的失效了:有 206 个。 AutomationBench Verified 修复了其中每一个。 在 1,235 次 Kimi K3 运行中,修复后的评分器有 27.9% 的情况给出了不同的判定。 最典型的是任务 813。评分器检查了 Salesforce 备注,却从未查看 DocuSign 模板。一份提交用 Standard 模板发送了四份合同,而不是要求的 GDPR、HIPAA、SOC2 和 Enterprise 模板,却通过了 13 项检查中的全部 13 项,得分 1.0。修复后它的得分是 0.09。
打开原帖#511482
  1. 产业

    Tomasz Tunguz:.@OpenAI 刚刚发布了数百个由其内部模型完成的高端数学证明和解答:…
  2. 产业

    Rohan Paul:诺贝尔奖得主、MIT 经济学家达龙·阿西莫格鲁(Daron Acemogl…
  3. 产业

    Rohan Paul:– https://arxiv.org/abs/2610.00583 标题…