Rohan Paul
@rohanpaul_ai
New Tsinghua + Qwen 团队的论文颠覆了通常的代理数据配方:
与模仿原始运行相比,重建和重新解决旧的代理工作区可以训练更好的编码代理
轨迹就像 1 个编码代理修复 1 个错误的记录:您只能复制该代理所做的事情。
相反,本文根据该记录重建了实际的代码工作区,因此您可以为同一工作区提供新的错误、新功能或更强大的代理,并从中生成许多新的训练示例。
这就是核心区别:轨迹=1个冻结解;环境 = 一个可重用的代码库,可以生成许多新的经过验证的任务,论文发现第二个对于训练代理来说要好得多。
在本文的 Terminus2 设置下,对所得数据进行 Qwen3.5-27B 训练将 Terminal-Bench 2.1 从 46.2% 移动到 58.1%,将 EvoCode-Bench v2 MT@4 从 6.3 移动到 20.1。
收集您可以重用的执行环境,而不仅仅是您可以模仿的更多跟踪。