Rohan Paul
@rohanpaul_ai
自我改进的人工智能代理需要修复自己的代码。
这篇来自美国+中国顶级实验室的论文表明,编码代理错过了大多数此类错误,但通过过去修复的经验教训进行了改进。
代理工具中的真正错误可以自动转化为一组不断增长的可运行测试。
代理自己的代码是模型周围的一切:工具调用、内存和提示。它的错误取决于实时模型调用,这使得它们很难重新创建和测试。
因此,研究人员构建了 AgentBug-Smith,它将真实的 GitHub bug 报告转化为可运行的测试。结果是一个包含 200 个 bug 的基准测试不断增长。
最好的 3 种编码代理仅修复了 9% 的错误,而常规软件错误的修复率约为 40%。过去修复中的经验教训的简短指南使代理对 79 个看不见的错误的修复次数从 1 次正确修复到 6 次。
在将您的代理代码信任给编码代理之前,请尝试修复您已修复的错误。