ServiceNow CoreAI 在 Hugging Face 发布 AutoSynthData,用来给企业环境里的智能体造训练数据。文章写,一个模型可以能力很宽,仍会在某个环境里卡住:某条流程做不好,某组工具用错,或某条约束没守住。单次失败说明不了怎么训练。训练需要许多新任务,考的是同一种能力,但情景不同;任务必须在这个环境里做得成,像真人会提出的请求,并且有可靠办法检查做完没有。
[1]
他们把任务写成三块:系统说明、用户请求、检验器。系统说明包括指令、环境政策和必要的初始状态,不能靠任意加限制来制造难度。用户请求要同时满足三点:做得到,像真的工作,而且当前模型还不能稳定做对。检验器要和请求、说明、状态一致,拒绝没做完或违规的轨迹,也要接受其他合法解法,而不是只认一条参考路径。过松会奖励错误行为,过严会惩罚合法解法。
在 EnterpriseOps Gym 的实验里,目标模型和更强的教师都跑评测任务。他们记下考的是哪种能力、用了哪些工具、目标模型错在哪、教师怎么做对,以及正确终态必须满足什么。这些发现收成能力说明卡。评测任务只用来决定该学什么。生成器拿不到原来的提示、实体、轨迹和检验器细节,只用卡片造出提示、状态和解法都不同的新任务。
[1]造数据分两段。Target 段按说明卡并行生成核心样本,每条都要经过校验、执行、求解和修复。Multiply 段把已通过的样本扩成新变体,变体有自己的请求、状态、实体、参考轨迹和检验器,而且不能再拿变体去派生变体。
这里用的难度配置是:目标模型三次里最多做对一次,更强的求解器三次里至少做对两次。正向检查会在环境里执行参考轨迹,看结果能不能通过检验器。反向检查会改动预期结果的一部分,确认那些状态不再算成功。失败样本先交给批评者,在有限次数内改原候选,再重跑关卡。批次层面还会看哪些题族太多、哪些能力还缺,并据此调整下一批。
文章写,有用的训练分布会随模型变。微调之后,已经能稳定做对的任务对下一轮用处下降,仍然失败的能力继续指向该生成什么。实验做的是监督微调。同一套机制可以用来做强化学习,但他们写的是计划去测,这次没有测。
[1]Hybrid 域用 Gemma-4-26B-A4B-it 做目标模型,Qwen3.8-27B 做教师。大约 18 小时生成 2000 条合成样本。微调后最好的检查点是第 5 个 epoch。平均 Pass@1 提高 7.2 个百分点,相对提高 35%,检验器成功率从 63.01% 升到 68.55%。它补上了 Gemma 和参考模型之间原来 Pass@1 差距的 59%。文章没有写出参考模型的名字,也没有给出 Hybrid 上 Pass@1 的绝对起止值。训练题是按能力说明新生成的,生成器没有拿到原来的评测任务。结果说明的是 EnterpriseOps Gym Hybrid 这个环境,不是任意企业环境。
ITSM 域仍用这颗 Gemma 做目标,教师换成 DeepSeek-V4.1-Flash。1994 条样本花了 66 小时。文章说,这一轮更慢,主要因为教师更大,而且跑在后来提高吞吐的流水线优化之前。合成监督微调把平均 Pass@1 从 18.77% 提高到 27.18%。这是第二个域里的提高,不是把 Hybrid 的 7.2 个百分点挪过来。
[1]要点
- 生成器只拿到能力说明卡,拿不到原评测的提示、实体、轨迹和检验器。
- 所用配置里,目标模型三次最多对一次,更强求解器三次至少对两次。
- Hybrid:约 18 小时生成 2000 条。Gemma 平均 Pass@1 提高 7.2 个百分点,检验器成功率从 63.01% 到 68.55%。
- ITSM:1994 条花了 66 小时,Pass@1 从 18.77% 到 27.18%。实验是监督微调,强化学习还没测。