一篇 9 月 22 日上线的 arXiv 论文(arXiv:2609.24997)提出 VideoGen-Agent:一个通过多任务 agentic 强化学习训练、学会调用外部工具做视频生成的多模态智能体。它把视频生成拆成六类能力(程序性知识、单实体一致性、多实体一致性、物理模拟、组合场景、多镜头时序),围绕三组工具(检索/增强、生成、验证)自主决策:先检索文本知识与视觉参考、模拟运动,再生成候选,最后用目标检测与深度估计验证并迭代修正。训练上先做 16K 条教师轨迹的 SFT,再用多任务 GRPO 强化,混合奖励同时考核工具调用有效性、任务适配度与成片质量。
[1][2]先说这篇论文解决了什么问题。视频生成模型现在不缺"画得好",缺的是"按流程做对":生成一个符合物理规律的落体、保持某个品牌形象跨镜头一致、按顺序呈现多个阶段——这些靠单次提示很难做到。VideoGen-Agent 的思路是把生成从"一次调用"变成"一个 agent 工作流":模型在思考—动作—观察的循环里自主决定先查什么、用什么生成、再验证什么,生成工具只是它工具箱里的一个组件。这等于把视频生成从单一模型问题改写成"工具编排"问题。
结果数据(论文自报)分三层。第一,在自建留出基准 VABench(600 条提示、覆盖六类能力)上,VideoGen-Agent 把基础文生视频生成器的分数从 56.5 提到 75.6(+19.1 分),评测采用分类别的 VLM 评分标准并验证了与人类偏好的一致性。第二,把底层生成工具换成更强的模型,分数进一步升到 86.1——而且不需要再训练 agent,这说明"学到的工具使用"与"更强的生成工具"是互补的。第三,人类评估中 84.3% 的对比里评审者更偏好该配置而非最强单模型基线。消融实验确认了 SFT 与 RL 两阶段、以及混合奖励各组件的贡献。
口径与局限:VABench 与 VLM 评分标准均为论文自建,84.3% 人类偏好由作者团队收集;六类能力的具体工具依赖(检索、模拟、检测、深度估计)在真实生产环境中的成本与延迟未给出;"程序性知识/身份保持"类任务对检索源与底模型质量的敏感性也待独立测试。放回行业脉络:它与上个月 Gen-Searcher(检索增强的图像生成 agent)、近期 VISTA(测试时迭代精修)一脉相承——生成模型能力趋同之后,"会调用工具、会自我验证"的 agent 层正在成为拉开差距的新位置,视频生成可能是这个趋势里最直观的试验场。
[1][2]