DeepMind 论文:Veo 3 展现零样本视觉推理,或成视觉基础模型

RexDouglass · x · 2026-09-17

Google DeepMind 论文《Video models are zero-shot learners and reasoners》展示 Veo 3 能零样本解决大量未专门训练的任务:物体分割、边缘检测、图像编辑、物理属性理解、工具使用模拟,乃至走迷宫、解对称等早期视觉推理,作者认为视频模型正走上成为统一视觉基础模型的路径——如同 LLM 之于语言。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →