Rohan Paul

@rohanpaul_ai

Meta 新论文发现:让 2 个不同的编程智能体互相审查补丁,比给 1 个智能体更多预算,能抓到多得多的隐性 bug。 在同一任务上混用 Claude Code 和 Codex,在花费相同的情况下,完全正确的补丁比例从 45.8% 提升到 62.5%。 智能体在修改真实训练代码时,可能泄露测试数据、弄坏梯度,或把某个开关接错。 代码照样能跑,于是你烧掉了 GPU 时长,得到的数字看起来却是有效的。 原因在于错误互不相关:来自同一产品的智能体会以同样的方式出错,所以审查能抓到的东西很少。这一效应在另一个无关的训练代码库上也得到了复现。 – arxiv. org/abs/2609.39551 标题:《RankEvolve:一个用于演化排序模型的可靠多智能体自动研究框架》("RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models")
打开原帖#511482
  1. 产业

    Alexandr Wang:今天清空日程,给 Muse 做媒体培训 😑
  2. 产业

    Clément Delangue:对此超级兴奋,我也知道权重马上就会放出(https://huggingfa…
  3. 产业

    Aravind Srinivas:Perplexity 在 Hugging Face 决策指数(Decisi…