Rohan Paul
@rohanpaul_ai
在此基准测试中,最佳编码代理设置仅通过了 23.9% 的保留客户模拟。
ττ-bench 发现,当今的编码代理无法完成大多数现实的代理构建工作,因为它们对需求的理解不够深入,因此仅改进代码生成并不能解决问题。
ττ-bench 将代理构建视为真正的客户工作。
该模型获取分散的公司记录、客户、API、现有代码和预算,然后必须为看不见的客户请求派遣代理。
最好的设置,带有 Claude Code 的 Claude Opus 5,在 53 项任务中仅通过了 23.9% 的客户模拟,而专家编写的参考则为 82.2%。
大多数失败都发生在纯粹的编码之外。
代理们搜索记录而不是理解它们,几乎不询问客户,重复使用熟悉的设计,并编写经常遗漏自己错误的测试。
在客户端启用的任务中,构建询问 0 个问题的平均值为 0.16;要求 4+ 的人平均为 0.50。
因此,更好的编码模型是不够的,我们还需要编码代理来收集需求、比较设计、智能地使用预算,并在部署之前运行测试来暴露自己的盲点。