DeepMind 认为视频生成模型可以变成通用视觉模型
jiqizhixin · x · 2026-07-23
Google DeepMind 联合多所高校提出 GenCeption,主张把 文本到视频生成模型 当作通用视觉任务的共享骨干,而不是为每个感知任务单独训练模型。
核心思路
- 先用预训练的视频生成器学习时空结构与语言对齐。
- 再把这个 backbone 迁移到深度估计、法线预测、相机位姿、表达参考分割、3D 关键点预测等任务。
论文里报告的结果
- 在上述任务上,效果可与或优于 DepthAnything、SAM、VGGT 等专用模型。
- 也优于 V-JEPA 和 Video MAE 等预训练方法。
- 作者声称训练数据量可减少 7 倍到 500 倍。
- 只用合成的人类视频训练,也能泛化到真实世界中的动物和机器人视频。
这篇工作想传达的结论很直接:视频生成模型可能不只是生成器,也能成为通用视觉学习器。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27