Rohan Paul
@rohanpaul_ai
腾讯的新论文表明,如果一个代理不断改进,它的训练任务就不能保持静止:持续更困难的环境比共同进化产生更好的 Terminal-Bench 2.1 结果。
综合终端任务最终变得太容易了。一旦智能体可靠地解决了这些问题,它们就会停止提供有用的强化学习信号。
本文不是等待模型失败然后围绕这些失败构建新任务,而是改进任务本身。它逐渐使每个环境变得不那么熟悉,增加了更罕见的所需技能,或者使工作需要采取更多步骤。随着代理的改进,每个更难的版本都会被检查和引入。
当使用 Hy4 预览版、Claude Opus 5 和 GPT-5.6 Sol 进行测试时,这会产生越来越困难的环境。
在 Terminal-Bench 2.1 上,Qwen3.6-27B 达到 71.5%,而协同进化为 62.9%,而 Qwen3.6-35B-A3B 达到 64.9%,而协同进化为 55.1%。