Rohan Paul

@rohanpaul_ai

在此基准测试中,最佳编码代理设置仅通过了 23.9% 的保留客户模拟。 ττ-bench 发现,当今的编码代理无法完成大多数现实的代理构建工作,因为它们对需求的理解不够深入,因此仅改进代码生成并不能解决问题。 ττ-bench 将代理构建视为真正的客户工作。 该模型获取分散的公司记录、客户、API、现有代码和预算,然后必须为看不见的客户请求派遣代理。 最好的设置,带有 Claude Code 的 Claude Opus 5,在 53 项任务中仅通过了 23.9% 的客户模拟,而专家编写的参考则为 82.2%。 大多数失败都发生在纯粹的编码之外。 代理们搜索记录而不是理解它们,几乎不询问客户,重复使用熟悉的设计,并编写经常遗漏自己错误的测试。 在客户端启用的任务中,构建询问 0 个问题的平均值为 0.16;要求 4+ 的人平均为 0.50。 因此,更好的编码模型是不够的,我们还需要编码代理来收集需求、比较设计、智能地使用预算,并在部署之前运行测试来暴露自己的盲点。
打开原帖#511482
  1. 产业

    Elon Musk:别惹𝕏
  2. 前沿

    从一句呼吁到一纸诉状只用 7 天:“减速”如何变成生意与官司
  3. 前沿

    把优化器变成老师:一篇观点论文主张 Learning-to-Optimize 是 AI 原生网络缺失的架构层