DeepMind 论文:Veo 3 展现零样本视觉推理,或成视觉基础模型
RexDouglass · x · 2026-09-17
Google DeepMind 论文《Video models are zero-shot learners and reasoners》展示 Veo 3 能零样本解决大量未专门训练的任务:物体分割、边缘检测、图像编辑、物理属性理解、工具使用模拟,乃至走迷宫、解对称等早期视觉推理,作者认为视频模型正走上成为统一视觉基础模型的路径——如同 LLM 之于语言。
- 合著者 Shixiang Shane Gu(曾参与 "LLMs are Zero-Shot Reasoners"、"LLMs Can Self-Improve")回应学界对机器人领域被零样本刷榜的悲观情绪:数字/符号 AGI 必然先于并加速物理 AI
- 他认为视频模型虽是强大的零样本推理器,LLM 仍是物理 AGI 各环节不可或缺的核心,过去一年他在 Gemini、Omni 与生成媒体方向验证了这一假设
- Lerrel Pinto 提到 Astra、Fable、Muse 正在机器人与世界模型基准上零样本碾压,这正是跨越式进步的样子
「漫话AGI」频道最新
- EA 圈论战:AI 末日论根源在贫瘠的功利主义世界观 — AndyMasley · 2026-09-17
- 帕特森预言:2026 年底触及 AGI 软边缘,2030 年达硬极限 — davidpattersonx · 2026-09-17
- Gary Marcus 回怼 Noah Smith:谁说过「AI 是假的」? — GaryMarcus · 2026-09-17
- 教 Claude 意识到自己有意识,对齐问题将变成管理一个「异议者」 — rohanpaul_ai · 2026-09-17
- Grady Booch:当代 AI 之于认知,如代糖之于营养 — Grady_Booch · 2026-09-17
- 投资人:创业圈模型坍缩,新公司创意正处局部谷底 — emilyzsh · 2026-09-17