Rohan Paul
@rohanpaul_ai
上海人工智能实验室的新论文发现,用人类编写的智能体技能的已验证运行记录进行训练,能让模型成为更好的智能体,即使不提供技能文件也是如此。
提示时加载的技能依赖检索和指令遵循,而在已验证的技能运行记录上微调可以减少这种依赖。
把每个技能文件变成一个带通过/失败检查器的沙箱任务,由此产生的训练数据让 Claude Code 中的 Terminal-Bench 2.1 成功率提升了 19.10 个百分点。
技能文件通常放在提示里,所以只有智能体找到并遵循它们时才有帮助。
SkillGym 把每项技能变成带代码检查器的沙箱任务,然后用通过的运行记录来训练。
在 Claude Code 中,Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上从 39.33% 跃升到 58.43%。在不提供技能文件的情况下,它在 SkillsBench 上得分 26.81%,超过了带技能的基础模型的 23.34%。
在此基础上再加载技能仍然有帮助,可提升到 51.47%。