The Decoder 9 月 27 日报道,一支有复旦大学研究者参与的团队,回头分析了自己做模型时人和代理怎样分工。材料是 700 多条任务日志、56 名参与者,以及这些代理的日志。项目的模型叫 Atria Dawn Preview,混合专家架构,7440 亿参数,面向研究和工程任务。

团队说,它在 16 项基准里领先 5 项,其中包括网页搜索和网络安全,但整体并不领先对手。报道点名:AutomationBench、CyberGym 和 MLE-Bench Lite 领先,GDPval 和 SWE-Bench Pro 落后。训练把每个任务接到真实执行环境,用测试、指标或原始材料来核对。

[1]
刺绣:一只手挑起一根红线,左边已经有一长串针脚。
针脚已经走了很远,手仍在选下一针。它对应执行变多、决定仍由人做,不是实验室照片。, AI 生成插画,不是新闻照片

被审阅的任务里,96.5% 用了 AI。四周之内,代理动作与人类输入之比的中位数从 11 升到 28.5。团队明确提醒,不要把这读成自主性增加:人的每一个决定带出更多代理步骤,并不等于代理自己做了更多决定。

455 项已经完成、并且用了 AI 的任务里,151 项被评为没有 AI 就达不到同样的范围和质量,大约三分之一。这 151 项分布在 56 人中的 27 人身上,不是少数重度用户做出来的。方法和参数上,最常见的模式是 AI 提议、人来选择,占 55.4%。总体上,方法和参数的决定 85.5% 由人做出,AI 占 9.2%。目标和范围的最终决定,93.4% 由人做出。即便在那 151 项被认为离了 AI 就做不成的任务里,目标仍有 95.4% 由人选定。

[1]

588 项记录了困难的任务里,76% 靠人介入才往下走,23% 由代理自己解决。人的帮助几乎都是信息:补充上下文或澄清要求占 35.2%,诊断问题并改换方法占 34.7%。人很少亲手做,部分修改占 3.2%,完全接手占 0.7%。输出需要修改时,人给出反馈之后,75.4% 的修改由 AI 自己完成。

团队写了一种风险:每个决定下面如果都是人看不完的代理链条,人可能只剩下盖章。不少参与者为了不打断长时间运行,让代理处在自主模式。这条边界是为了省事,不是一次关于该给多少权限的正式决定。这是团队对自己项目的研究,不是外部审计。报道后半还提到其他实验室的说法,本篇没有把那些数字写成这项研究的测量结果。

[1]

要点

  • Atria Dawn Preview 为 7440 亿参数的混合专家模型,16 项基准里领先 5 项,整体不领先。
  • 代理动作与人类输入的中位数之比四周内从 11 升到 28.5,团队说这不是自主性增加。
  • 方法和参数的决定 85.5% 由人做,目标的最终决定 93.4% 由人做。
  • 困难任务里完全接手只占 0.7%。研究的是团队自己的项目。