Rohan Paul
@rohanpaul_ai
Claude Opus 5 在作为自动化 AI 研究员工作时,把一个 Qwen 模型的 SWE-bench Verified 分数几乎提高了两倍。
@Evolvent_AI 新发布的开源 RSIGym 让这一测量成为可能:它允许 AI 智能体在同一个有预算约束的环境中重新训练模型并改写其 harness。
结果表明,当前沿 AI 智能体把训练、服务和测试当作现成服务时,可以显著改进另一个 AI 模型。
智能体从仅有 CPU 的容器起步,调用远程服务完成 LoRA 微调、模型服务、基准测试和沙箱,费用都记入每次运行的预算。
在主要测试中,6 个前沿智能体从 Qwen3.5-35B-A3B-Base 和一个最简 harness 起步,每个基准有 500 美元的服务预算。
如果你要改进一个智能体,先读它的失败日志并修 harness:在 10 项小型测试里,有 8 项加重训练反而得分更低。