视频生成模型也能学视觉

zhenjun_zhao · x · 2026-07-14

这条帖分享了一篇题为 “Video Generation Models are General-Purpose Vision Learners” 的工作,核心意思是:视频生成模型不只是会“生成视频”,还可以作为通用视觉表征学习器。

帖中给出的简要脉络是:

从标题和 tl;dr 来看,这项工作在讨论视频生成模型如何迁移到更广泛的视觉理解能力上。

所属事件:GenCeption:视频生成模型即通用视觉学习器(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →