普林斯顿 VideoGen-Agent:多任务智能体 RL 调工具,视频生成提 19 分
princetonu · hf · 2026-09-22
视频生成模型在高保真与时间一致性上进步明显,但难以满足需要专业知识、特定身份、物理一致性或有序事件的 prompt。普林斯顿提出 VideoGen-Agent:一个经多任务智能体强化学习训练的多模态 agent,通过多轮交互协调增强、生成与验证三类外部工具来完成视频生成。训练先在类别均衡的六任务数据上用教师轨迹做 SFT 建立工具使用行为,再用类别感知的混合奖励(工具调用有效性、任务适配的工具选择、生成视频质量)做 RL 精调。
同时发布 VABench——600 条 prompt 的 held-out 基准,覆盖程序性知识、单/多实体身份保持、物理一致性、场景构图与多镜头时间结构。结果:VideoGen-Agent 较基础文生视频模型提升 19.1 分(56.5→75.6);仅升级生成工具(不再训练)即达 86.1;人类评估者在 84.3% 的对比中偏好升级配置。结论表明训练出的工具使用策略能随底层生成模型进步而免费受益。
「多模态」频道最新
- 用 Sentinel 可视化人类运动轨迹,效果惊艳 — Kyrannio · 2026-09-22
- 用户实测新版 Pika:质量漂亮,老牌玩家重回赛场 — Kyrannio · 2026-09-22
- 腾讯混元图像 3.5 登陆 OnSolo:5 张参考图 2K 输出仅 1 积分 — Div_pradeep · 2026-09-22
- AI 生图「博物馆雕像被调包」梗图走红,作者附上 prompt — umesh_ai · 2026-09-22
- Intel 为 Qwen-Image-2.1 提供首日 OpenVINO 优化支持 — Alibaba_Qwen · 2026-09-22
- Pexo 实测:对话式操作做出 30 秒 SpaceX 概念品牌大片 — SimplyAnnisa · 2026-09-22