Rohan Paul
@rohanpaul_ai
Meta 新论文发现:让 2 个不同的编程智能体互相审查补丁,比给 1 个智能体更多预算,能抓到多得多的隐性 bug。
在同一任务上混用 Claude Code 和 Codex,在花费相同的情况下,完全正确的补丁比例从 45.8% 提升到 62.5%。
智能体在修改真实训练代码时,可能泄露测试数据、弄坏梯度,或把某个开关接错。
代码照样能跑,于是你烧掉了 GPU 时长,得到的数字看起来却是有效的。
原因在于错误互不相关:来自同一产品的智能体会以同样的方式出错,所以审查能抓到的东西很少。这一效应在另一个无关的训练代码库上也得到了复现。
– arxiv. org/abs/2609.39551
标题:《RankEvolve:一个用于演化排序模型的可靠多智能体自动研究框架》("RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models")