DeepMind 认为视频生成模型可以变成通用视觉模型
jiqizhixin · x · 2026-07-23
Google DeepMind 联合多所高校提出 GenCeption,主张把 文本到视频生成模型 当作通用视觉任务的共享骨干,而不是为每个感知任务单独训练模型。
核心思路
- 先用预训练的视频生成器学习时空结构与语言对齐。
- 再把这个 backbone 迁移到深度估计、法线预测、相机位姿、表达参考分割、3D 关键点预测等任务。
论文里报告的结果
- 在上述任务上,效果可与或优于 DepthAnything、SAM、VGGT 等专用模型。
- 也优于 V-JEPA 和 Video MAE 等预训练方法。
- 作者声称训练数据量可减少 7 倍到 500 倍。
- 只用合成的人类视频训练,也能泛化到真实世界中的动物和机器人视频。
这篇工作想传达的结论很直接:视频生成模型可能不只是生成器,也能成为通用视觉学习器。
「多模态」频道最新
- Seedance2 视频转视频靠 depth video 和角色参考图提效 — Horror_Dirt6176 · 2026-07-23
- Wired:Jibo 后继者是一款把生活变成 AI 内容的可穿戴设备 — Wired AI · 2026-07-23
- 布洛姆坎普13分钟科幻短片全由Seedance 2.0 4K制作 — testingcatalog · 2026-07-23
- AI 生成的世界杯决赛高光拿下 2800 万观看 — techhalla · 2026-07-23
- Midjourney 的 3203007452 SREF 码主打可爱极简风 — aziz4ai · 2026-07-23
- GPT图像提示词玩法:用镜像反射揭示品牌隐藏身份 — aziz4ai · 2026-07-23