DeepMind 认为视频生成模型可以变成通用视觉模型
jiqizhixin · x · 2026-07-23
Google DeepMind 联合多所高校提出 GenCeption,主张把 文本到视频生成模型 当作通用视觉任务的共享骨干,而不是为每个感知任务单独训练模型。
核心思路
- 先用预训练的视频生成器学习时空结构与语言对齐。
- 再把这个 backbone 迁移到深度估计、法线预测、相机位姿、表达参考分割、3D 关键点预测等任务。
论文里报告的结果
- 在上述任务上,效果可与或优于 DepthAnything、SAM、VGGT 等专用模型。
- 也优于 V-JEPA 和 Video MAE 等预训练方法。
- 作者声称训练数据量可减少 7 倍到 500 倍。
- 只用合成的人类视频训练,也能泛化到真实世界中的动物和机器人视频。
这篇工作想传达的结论很直接:视频生成模型可能不只是生成器,也能成为通用视觉学习器。
「多模态」频道最新
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11