Rohan Paul

@rohanpaul_ai

New Tsinghua + Qwen 团队的论文颠覆了通常的代理数据配方: 与模仿原始运行相比,重建和重新解决旧的代理工作区可以训练更好的编码代理 轨迹就像 1 个编码代理修复 1 个错误的记录:您只能复制该代理所做的事情。 相反,本文根据该记录重建了实际的代码工作区,因此您可以为同一工作区提供新的错误、新功能或更强大的代理,并从中生成许多新的训练示例。 这就是核心区别:轨迹=1个冻结解;环境 = 一个可重用的代码库,可以生成许多新的经过验证的任务,论文发现第二个对于训练代理来说要好得多。 在本文的 Terminus2 设置下,对所得数据进行 Qwen3.5-27B 训练将 Terminal-Bench 2.1 从 46.2% 移动到 58.1%,将 EvoCode-Bench v2 MT@4 从 6.3 移动到 20.1。 收集您可以重用的执行环境,而不仅仅是您可以模仿的更多跟踪。
打开原帖#511482
  1. 产业

    Rohan Paul:– https://arxiv.org/abs/2609.04148 标题…
  2. 产业

    Rohan Paul:《神鬼寓言 5》到《神鬼寓言 5.1》,写作风格发生了很大的变化, Cla…
  3. 产业

    Rohan Paul:Meta 的人工智能机会可能远远超出制作广告的范围