DeepMind 认为视频生成模型可以变成通用视觉模型
jiqizhixin · x · 2026-07-23
Google DeepMind 联合多所高校提出 GenCeption,主张把 文本到视频生成模型 当作通用视觉任务的共享骨干,而不是为每个感知任务单独训练模型。
核心思路
- 先用预训练的视频生成器学习时空结构与语言对齐。
- 再把这个 backbone 迁移到深度估计、法线预测、相机位姿、表达参考分割、3D 关键点预测等任务。
论文里报告的结果
- 在上述任务上,效果可与或优于 DepthAnything、SAM、VGGT 等专用模型。
- 也优于 V-JEPA 和 Video MAE 等预训练方法。
- 作者声称训练数据量可减少 7 倍到 500 倍。
- 只用合成的人类视频训练,也能泛化到真实世界中的动物和机器人视频。
这篇工作想传达的结论很直接:视频生成模型可能不只是生成器,也能成为通用视觉学习器。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11