DeepMind 认为视频生成模型可以变成通用视觉模型

jiqizhixin · x · 2026-07-23

Google DeepMind 联合多所高校提出 GenCeption,主张把 文本到视频生成模型 当作通用视觉任务的共享骨干,而不是为每个感知任务单独训练模型。

核心思路

论文里报告的结果

这篇工作想传达的结论很直接:视频生成模型可能不只是生成器,也能成为通用视觉学习器。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →