一篇由浙江大学团队主导、9 月 17 日提交至 arXiv(编号 2609.20784)的论文提出 RetireOPD(自退役在策略蒸馏),用“自适应退役”机制解决多轮智能体强化学习中的蒸馏难题:当学生模型与教师的分歧不再缩小、且成功率达到教师指定比例时,学生自动放弃教师监督,转入纯强化学习训练。

[1]

问题出在奖励信号的密度上。用强化学习训练多轮 agent 时,每个轨迹只收到一个标量奖励,信号稀疏。自我在策略蒸馏(OPD)的思路,是用一个带特权任务技能的“自我教师”提供密集的 token 级监督,让无技能的学生内化这些技能。论文指出两个发现动摇这一配方:特权信息并不总是让教师可靠;教师监督的收益是分阶段的,并非全程有效。

RetireOPD 的做法分两步。先用环境奖励优化一个解耦的、以技能为条件的教师;再让学生同时接受 RL 与 OPD 联合训练。与预设蒸馏时间表不同,它的“自适应退役”让学生自己判断毕业时点:当学生与教师的差异停止缩小,且学生达到教师成功率的目标比例时,教师即被弃用,此后只用 RL 训练。论文称,这一机制不依赖预先定义的蒸馏节奏,而是由学生与教师的实际差距驱动。

结果是明确的。在 Qwen2.5 系列 1.5B 至 7B 模型上,RetireOPD 在 ALFWorld 上的成功率比 RL 基线提升 14.1% 至 18.8%,在 WebShop 上的精度提升 11.8% 至 19.0%,并且在每个设置下都超过了其自身的技能条件教师——也就是说,学生最终跑赢了提供监督的教师。

需要标注的是口径与局限:这些数字是论文自报结果,尚未经过第三方独立复现,论文也未经同行评审;“退役”的触发阈值(目标比例)是需要人工设定的超参数;评测环境 ALFWorld 与 WebShop 都是文本交互任务,未覆盖视觉或长时程 agent 场景。“自动毕业”解决的是监督何时退出,而不是监督本身的质量——后者仍是智能体强化学习里没有合上的一环。

[1]
深夜实验室里,研究者背影坐在双屏前,主屏上是荧光绿的成功率学习曲线抵达平台期,副屏是智能体在网格环境中操作的画面,身后 GPU 机柜指示灯闪烁
学生模型达到教师的成功率后,教师监督自动退出, AI 生成插画,非新闻照片