Rohan Paul

@rohanpaul_ai

自我改进的人工智能代理需要修复自己的代码。 这篇来自美国+中国顶级实验室的论文表明,编码代理错过了大多数此类错误,但通过过去修复的经验教训进行了改进。 代理工具中的真正错误可以自动转化为一组不断增长的可运行测试。 代理自己的代码是模型周围的一切:工具调用、内存和提示。它的错误取决于实时模型调用,这使得它们很难重新创建和测试。 因此,研究人员构建了 AgentBug-Smith,它将真实的 GitHub bug 报告转化为可运行的测试。结果是一个包含 200 个 bug 的基准测试不断增长。 最好的 3 种编码代理仅修复了 9% 的错误,而常规软件错误的修复率约为 40%。过去修复中的经验教训的简短指南使代理对 79 个看不见的错误的修复次数从 1 次正确修复到 6 次。 在将您的代理代码信任给编码代理之前,请尝试修复您已修复的错误。
打开原帖#511482
  1. 产业

    Rohan Paul:– https://arxiv.org/abs/2609.37864 标题…
  2. 产业

    Rohan Paul:Cathie Wood 解释了杰文斯悖论如何在人工智能中流行: 同样的答案…
  3. 产业

    Rohan Paul:全球数据中心债务融资的 90% 都集中在美国,有效企业税率约为 8%,因为…