自进化智能体(self-evolving agents)通常用自己生成的轨迹来训练自己,但谁来检查这份“自己写的答卷”?9 月 17 日提交到 arXiv 的论文《UnifiedPlayers》提出一个三方协作方案:让一个“规划玩家”出题、一个“执行玩家”解题、一个“评判玩家”当考官,三者共享一份由真实代码执行产生的证据表来互相制衡。论文在两个模型基座、12 个推理基准上的自报结果显示,它在数学推理上超过最强基线至少 3.5 个百分点,通用推理上超过至少 3.9 个百分点。

[1]

问题的起点是训练数据的死循环。工具型智能体需要大量“工具调用—观察—纠错”的真实轨迹,人工标注既慢又贵,于是不少实验室让模型自己生成训练数据。但现有做法通常把轨迹生成与评估分开:要么用固定不变的验证器,无法适应模型不断冒出的新失败模式;要么用自我一致性(self-consistency)信号,多份错误答案互相印证,反而强化了共有的错误。

UnifiedPlayers 试图同时改进规划、执行、评估三个环节,却撞上一个被称为“循环相互依赖”的难题:规划玩家改变任务分布,执行玩家改变轨迹形态,评判玩家改变奖励信号——三个组件各自都在改动另外两个的训练环境。论文的解法是把三者在 GRPO 强化学习下联合优化,但每次只更新一个玩家、其余两个保持固定;三者通过“判决矩阵”(verdict matrix)协调——在沙箱里对原始轨迹和对抗扰动轨迹逐一运行可执行验证器,得到一张谁对谁错的共享证据表,再为每个玩家提取不同的角色奖励;评判玩家还额外被要求生成多样化的验证代码,避免验证器模板化。

作者在两个基座(含 Qwen3-4B)和 12 个推理基准上报告:数学推理比最强基线高至少 3.5%,通用推理高至少 3.9%;学到的验证器对抗检测准确率达到 84.2%,其奖励信号的问题级方差是自我一致性基线的 2.03 倍,即更能区分不同解法的高下。消融实验把 Qwen3-4B-Base 的提升归因于有效规划(数学 2.5%、通用 2.3%)和评估结果(两项均 3.3%);用当轮“新鲜”反馈比用上一轮反馈高出 1.5% 和 1.7%。

需要保持克制的地方很明确:这是 arXiv 预印本,结果全部由作者自报,未经同行评审;基准均为常见推理测试集,是否存在污染、能否在更大模型上复现,论文没有给出保证。它最值得注意的不是某个分数,而是把“评估者本身也参与训练”从口号变成了可运行的机制——当模型自己出题、自己解题、自己判卷时,至少有一张由真实代码执行写下的共享判决表,让三个角色互相盯着。

[1]
深夜研究实验室,研究员背影在三块并排屏幕前工作,一条光流从规划窗口流向执行窗口再流入验证窗口
UnifiedPlayers 论文封面:三方协作训练中的光流与三屏工作台, AI 生成插画,非新闻照片