Rohan Paul

@rohanpaul_ai

Claude Opus 5 在作为自动化 AI 研究员工作时,把一个 Qwen 模型的 SWE-bench Verified 分数几乎提高了两倍。 @Evolvent_AI 新发布的开源 RSIGym 让这一测量成为可能:它允许 AI 智能体在同一个有预算约束的环境中重新训练模型并改写其 harness。 结果表明,当前沿 AI 智能体把训练、服务和测试当作现成服务时,可以显著改进另一个 AI 模型。 智能体从仅有 CPU 的容器起步,调用远程服务完成 LoRA 微调、模型服务、基准测试和沙箱,费用都记入每次运行的预算。 在主要测试中,6 个前沿智能体从 Qwen3.5-35B-A3B-Base 和一个最简 harness 起步,每个基准有 500 美元的服务预算。 如果你要改进一个智能体,先读它的失败日志并修 harness:在 10 项小型测试里,有 8 项加重训练反而得分更低。
打开原帖#511482
  1. 产业

    Michael Truell:@zeeg 修复即将到来
  2. 产业

    Elon Musk:@MichaelDell 复利增长是宇宙中最强大的力量
  3. 产业

    Elon Musk:Grok @Bot 可以模拟任何事物 https://t.co/EKeFB…