普林斯顿 VideoGen-Agent:多任务智能体 RL 调工具,视频生成提 19 分

princetonu · hf · 2026-09-22

视频生成模型在高保真与时间一致性上进步明显,但难以满足需要专业知识、特定身份、物理一致性或有序事件的 prompt。普林斯顿提出 VideoGen-Agent:一个经多任务智能体强化学习训练的多模态 agent,通过多轮交互协调增强、生成与验证三类外部工具来完成视频生成。训练先在类别均衡的六任务数据上用教师轨迹做 SFT 建立工具使用行为,再用类别感知的混合奖励(工具调用有效性、任务适配的工具选择、生成视频质量)做 RL 精调。

同时发布 VABench——600 条 prompt 的 held-out 基准,覆盖程序性知识、单/多实体身份保持、物理一致性、场景构图与多镜头时间结构。结果:VideoGen-Agent 较基础文生视频模型提升 19.1 分(56.5→75.6);仅升级生成工具(不再训练)即达 86.1;人类评估者在 84.3% 的对比中偏好升级配置。结论表明训练出的工具使用策略能随底层生成模型进步而免费受益。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →