视频生成Agent调工具,VABench从56.5提到75.6

VideoGen-Agent: Reinforcing Video Generation Agents

Binxu Li, Haoyi Duan, Yuhui Zhang, Yaohui Zhang, Zihao Lin, Kaituo Feng, Suozhi Huang, Xiangyi Li, Yu Li, Chunyuan Li, Shilong Liu, Mengdi Wang

cs.CV

2026-09-22

普林斯顿用多任务 agentic RL 训练视频生成智能体,协调检索、仿真、生成和检测。自建 VABench 600 条提示上,比底座 T2V 高 19.1 分(56.5→75.6);只换更强生成器、不再训练,总分到 86.1,人类对位 Seedance 2.0 时 84.3% 更偏好。

这篇在解决什么

扩散视频模型已经能出好看、时间连贯的镜头,但提示一涉及专项知识、特定身份、物理过程或有序事件,就容易漏步骤、认错人、违反重力。现有 agent 管线多为某一类目标手写工作流。要把检索、仿真、生成、校验放进同一个策略,并按提示和中间观察选工具,需要跨任务学习。

VideoGen-Agent 用一套共享多模态策略覆盖六类任务:程序知识、单实体身份、多实体身份、物理仿真、组合场景、多镜头。

方法

策略是 Qwen3-VL-8B-Instruct,多轮推理-行动-观察。工具分三组。增强:文本检索、图像检索、代码仿真。生成:T2V、I2V、多参考 R2V、运动条件 M2V。校验:目标检测、深度估计。默认工作流按任务写死方向,例如程序知识先搜文本再 T2V,多镜头用上一段末帧条件化下一段。

数据用 Claude Opus 4.7 按类造提示,教师(Gemini 3.1 Pro 或 Claude Opus 4.7)跑出 2.4 万条轨迹,1.6 万条做 SFT,8 千条留给 RL。失败动作掩掉损失但留在上下文。RL 用 GRPO,奖励三项加权:格式 0.1、类别相关 VLM 视频分 0.5、工具是否用对 0.4。先做组内相对优势,再按任务类别二次归一化。生成工具训练期固定为 Toolset 1;评测可换成更强的 Toolset 2,策略不再训练。

结果

VABench 每类 100 条共 600 条,Gemini 3.1 Pro 按训练同款量规打 0–100。

系统总分
Seedance 1.0(底座 T2V)56.5
Seedance 2.0(最强单模型)73.2
Agent + Toolset 175.6
Agent + Toolset 286.1

Toolset 1 相对底座 +19.1。Toolset 2 六类全最高,多实体从 65.3 到 86.7,多镜头从 81.7 到 94.6。相对 Seedance 2.0,程序知识 +14.1、多实体 +17.7、多镜头 +25.7,组合场景只 +2.9(对方已有 87.8)。100 对人工对位,四名评分者合计 84.3% 更偏好 Toolset 2。

消融(Toolset 1):改写提示 57.3,零样本给工具 59.5,SFT 69.2,完整 RL 75.6。去掉工具奖励掉到 71.2,去掉 VLM 奖励掉到 73.3。单任务 RL 总分 76.3,略高于共享策略的 75.6。训练中途可接入 π0.5 加 Ctrl-World 做动作到视频;未见过的「名人做专项动作」会同时触发文本和图像检索。

为什么重要

视频生成的短板经常不在「再把扩散做大」,而在提示需要的外部证据:步骤说明、参考脸、物理轨迹、分镜顺序。把这些做成工具,再用 SFT+RL 教一个 8B 策略何时调用,底座生成器不变也能涨 19 分。生成器升级不必重训 agent,说明策略学的是接口而不是某一版模型。组合场景涨得少,因为单模型已经强;物理类即使换工具也只有 69.2,仿真条件还没把这一类打穿。

局限与存疑

打分器和部分教师都是 Gemini 3.1 Pro,量规自洽、外部效度未独立校准。提示由 Claude 生成并由人类抽查,分布偏合成。六类工作流在系统提示里写得很死,泛化证据主要是一个拼接任务。生成工具质量和延迟仍是上限,校验只覆盖在场和空间结构。单任务训练略强,共享策略有折中。物理仿真仍是弱项。论文未报告端到端墙钟时间。

术语

原文与代码

相关论文

全部论文解读