VideoGen-Agent: Reinforcing Video Generation Agents
Binxu Li, Haoyi Duan, Yuhui Zhang, Yaohui Zhang, Zihao Lin, Kaituo Feng, Suozhi Huang, Xiangyi Li, Yu Li, Chunyuan Li, Shilong Liu, Mengdi Wang
cs.CV
2026-09-22
普林斯顿用多任务 agentic RL 训练视频生成智能体,协调检索、仿真、生成和检测。自建 VABench 600 条提示上,比底座 T2V 高 19.1 分(56.5→75.6);只换更强生成器、不再训练,总分到 86.1,人类对位 Seedance 2.0 时 84.3% 更偏好。
扩散视频模型已经能出好看、时间连贯的镜头,但提示一涉及专项知识、特定身份、物理过程或有序事件,就容易漏步骤、认错人、违反重力。现有 agent 管线多为某一类目标手写工作流。要把检索、仿真、生成、校验放进同一个策略,并按提示和中间观察选工具,需要跨任务学习。
VideoGen-Agent 用一套共享多模态策略覆盖六类任务:程序知识、单实体身份、多实体身份、物理仿真、组合场景、多镜头。
策略是 Qwen3-VL-8B-Instruct,多轮推理-行动-观察。工具分三组。增强:文本检索、图像检索、代码仿真。生成:T2V、I2V、多参考 R2V、运动条件 M2V。校验:目标检测、深度估计。默认工作流按任务写死方向,例如程序知识先搜文本再 T2V,多镜头用上一段末帧条件化下一段。
数据用 Claude Opus 4.7 按类造提示,教师(Gemini 3.1 Pro 或 Claude Opus 4.7)跑出 2.4 万条轨迹,1.6 万条做 SFT,8 千条留给 RL。失败动作掩掉损失但留在上下文。RL 用 GRPO,奖励三项加权:格式 0.1、类别相关 VLM 视频分 0.5、工具是否用对 0.4。先做组内相对优势,再按任务类别二次归一化。生成工具训练期固定为 Toolset 1;评测可换成更强的 Toolset 2,策略不再训练。
VABench 每类 100 条共 600 条,Gemini 3.1 Pro 按训练同款量规打 0–100。
| 系统 | 总分 |
| Seedance 1.0(底座 T2V) | 56.5 |
| Seedance 2.0(最强单模型) | 73.2 |
| Agent + Toolset 1 | 75.6 |
| Agent + Toolset 2 | 86.1 |
Toolset 1 相对底座 +19.1。Toolset 2 六类全最高,多实体从 65.3 到 86.7,多镜头从 81.7 到 94.6。相对 Seedance 2.0,程序知识 +14.1、多实体 +17.7、多镜头 +25.7,组合场景只 +2.9(对方已有 87.8)。100 对人工对位,四名评分者合计 84.3% 更偏好 Toolset 2。
消融(Toolset 1):改写提示 57.3,零样本给工具 59.5,SFT 69.2,完整 RL 75.6。去掉工具奖励掉到 71.2,去掉 VLM 奖励掉到 73.3。单任务 RL 总分 76.3,略高于共享策略的 75.6。训练中途可接入 π0.5 加 Ctrl-World 做动作到视频;未见过的「名人做专项动作」会同时触发文本和图像检索。
视频生成的短板经常不在「再把扩散做大」,而在提示需要的外部证据:步骤说明、参考脸、物理轨迹、分镜顺序。把这些做成工具,再用 SFT+RL 教一个 8B 策略何时调用,底座生成器不变也能涨 19 分。生成器升级不必重训 agent,说明策略学的是接口而不是某一版模型。组合场景涨得少,因为单模型已经强;物理类即使换工具也只有 69.2,仿真条件还没把这一类打穿。
打分器和部分教师都是 Gemini 3.1 Pro,量规自洽、外部效度未独立校准。提示由 Claude 生成并由人类抽查,分布偏合成。六类工作流在系统提示里写得很死,泛化证据主要是一个拼接任务。生成工具质量和延迟仍是上限,校验只覆盖在场和空间结构。单任务训练略强,共享策略有折中。物理仿真仍是弱项。论文未报告端到端墙钟时间。