视频生成模型也能做理解
机器之心 · wechat · 2026-07-15
这篇文章介绍谷歌 DeepMind 的新论文 《Video Generation Models are General-Purpose Vision Learners》,核心方法叫 GenCeption:把预训练视频生成模型改造成一个由文本指令控制的通用视频理解系统。
关键思路
- 作者认为,视频生成可以像语言里的 next-token prediction 一样,成为视觉领域的通用预训练目标,因为它同时要求模型学习时空演化、三维结构和物理规律,并且天然与文本对齐。
- GenCeption 直接复用文生视频扩散模型,把原本从噪声逐步去噪的生成过程,改成单步前馈理解:输入无噪声视频潜表示,在固定时间步 t=0 下完成一次推理。
- 同一模型可通过不同文本指令切换任务,例如输出深度、法线、分割、相机位姿或 3D 关键点。
统一多任务的方式
- 密集任务(深度、法线、分割、相机射线图等)统一编码到 RGB 形式,继续沿用生成模型的输出范式。
- 稀疏任务(2D/3D 关键点)则额外加入可学习 token,再用轻量 MLP 解码坐标。
- 所有任务统一用 L2 损失 训练,更多差异放在数据表示层而不是任务专用头上。
数据与实验
- 研究团队主要使用合成数据:基于 800 个 RenderPeople 资产 和 200 种动作,生成 7500 段人体视频,同步得到深度、法线、分割、DensePose、2D/3D 关键点和相机位姿等标注。
- 实验显示,GenCeption 在多个任务上接近或超过 DepthAnythingV3、SAM3、D4RT、VGGT-Ω、Sapiens、Genmo 等专用模型。
- 通用版(Generalist)与专用版(Specialist)差距不大,说明一个统一模型可以较好覆盖多种视觉任务。
- 与 V-JEPA、VideoMAEv2 等表征学习主干相比,生成式预训练的 WAN2.1 在深度等任务上更强。
泛化与结论
- 模型不仅能处理真实视频,还能迁移到多人场景、动物、猩猩和机器人等未见类别,说明大规模视频生成预训练中已经包含较强的世界知识。
- 论文想证明的是:视频生成式预训练可以学习到支持多种视觉理解任务的通用表征,但“生成即理解”仍更多成立于结构信息层面,离动作语义和因果推理还有距离。
所属事件:GenCeption:视频生成模型即通用视觉学习器(6 条相关)→
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11