视频生成模型也能做理解

机器之心 · wechat · 2026-07-15

这篇文章介绍谷歌 DeepMind 的新论文 《Video Generation Models are General-Purpose Vision Learners》,核心方法叫 GenCeption:把预训练视频生成模型改造成一个由文本指令控制的通用视频理解系统。

关键思路

统一多任务的方式

数据与实验

泛化与结论

所属事件:GenCeption:视频生成模型即通用视觉学习器(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →