Rohan Paul

@rohanpaul_ai

腾讯的新论文表明,如果一个代理不断改进,它的训练任务就不能保持静止:持续更困难的环境比共同进化产生更好的 Terminal-Bench 2.1 结果。 综合终端任务最终变得太容易了。一旦智能体可靠地解决了这些问题,它们就会停止提供有用的强化学习信号。 本文不是等待模型失败然后围绕这些失败构建新任务,而是改进任务本身。它逐渐使每个环境变得不那么熟悉,增加了更罕见的所需技能,或者使工作需要采取更多步骤。随着代理的改进,每个更难的版本都会被检查和引入。 当使用 Hy4 预览版、Claude Opus 5 和 GPT-5.6 Sol 进行测试时,这会产生越来越困难的环境。 在 Terminal-Bench 2.1 上,Qwen3.6-27B 达到 71.5%,而协同进化为 62.9%,而 Qwen3.6-35B-A3B 达到 64.9%,而协同进化为 55.1%。
打开原帖#511482
  1. 产业

    Rohan Paul:马克·扎克伯格刚刚透露,Meta 已经在训练后西瓜模型。
  2. 产业

    Rohan Paul:在浏览器上看到 ChatGPT 的一个奇怪问题。
  3. 产业

    Garry Tan:马具大战现已全面展开,Muse 令人印象深刻