视频生成可做通用视觉预训
GoogleDeepMind · hf · 2026-07-13
Google DeepMind 这篇论文提出 GenCeption:把大规模文本到视频生成看作通向通用视觉智能的预训练路径。
核心观点是,视频生成式预训练能提供时空先验、视觉-语言对齐和可扩展性;在深度、法线、相机位姿、表达式分割、3D 关键点等多项任务上,GenCeption 达到或超过专用模型。论文还显示,和 V-JEPA、Video MAE 等预训练方式相比,视频生成骨干在相近设置下更强,而且数据效率很高,在部分任务上只需领先模型 1/7 到 1/500 的训练数据。
作者还观察到一些涌现能力:只用合成的人类视频训练,也能泛化到真实世界视频以及动物、机器人等分布外对象。
所属事件:GenCeption:视频生成模型即通用视觉学习器(6 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11