视频生成可做通用视觉预训

GoogleDeepMind · hf · 2026-07-13

Google DeepMind 这篇论文提出 GenCeption:把大规模文本到视频生成看作通向通用视觉智能的预训练路径。

核心观点是,视频生成式预训练能提供时空先验、视觉-语言对齐和可扩展性;在深度、法线、相机位姿、表达式分割、3D 关键点等多项任务上,GenCeption 达到或超过专用模型。论文还显示,和 V-JEPA、Video MAE 等预训练方式相比,视频生成骨干在相近设置下更强,而且数据效率很高,在部分任务上只需领先模型 1/7 到 1/500 的训练数据。

作者还观察到一些涌现能力:只用合成的人类视频训练,也能泛化到真实世界视频以及动物、机器人等分布外对象。

所属事件:GenCeption:视频生成模型即通用视觉学习器(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →