DeepMind 联合哈佛斯坦福发白皮书:视觉智能或是通向 AGI 之路
rohanpaul_ai · x · 2026-09-12
Google DeepMind、Harvard、Stanford、Oxford 等机构 21 位研究者联合发布白皮书《Visual General Intelligence: A White Paper》,提出以视觉为中心的智能路径可能通向 AGI(称为 VGI)。
- 核心类比:语言领域 GPT 系列通过 Transformer 架构 + 网络规模文本的自回归训练 + 激进 scaling 实现了向未见任务的迁移;论文追问同样的事能否发生在图像、视频、几何等视觉模态上。
- 现状批评:当前多模态 AI 大多把视觉当作喂给语言模型的输入,而论文主张视觉系统应更多“自己思考”——直接从图像、视频、3D 数据中学习,构建世界模型、记住变化、预测结果并采取行动。
- 论文不试图给出视觉智能的单一定义,而是梳理 AGI 时代计算机视觉应追求的原则、视觉输入模态、benchmark、学习范式,以及以视觉为核心时与语言等其他模态的关系。
所属事件:DeepMind 联合哈佛斯坦福:视觉智能或是 AGI 路径(2 条相关)→
「研究」频道最新
- 带持久记忆的去噪模型成迭代求解器, Sudoku-Extreme 达 99.9% — LucaAmb · 2026-09-12
- MIT 教授:Astra 自造科学仪器,超材料强度达参考工作 2.1 倍 — ProfBuehlerMIT · 2026-09-12
- Gary Marcus 阵营:分子性质预测都做不好,GPT-6 谈何 AGI — GaryMarcus · 2026-09-12
- 果蝇大脑连接体被搬进模拟器,竟能玩节奏光剑 — LinusEkenstam · 2026-09-12
- 有人教会果蝇连接体下棋,当前等级分约 700 可在线对战 — dejavucoder · 2026-09-12
- WUJI 开源 MINT:从第一视角视频重建 3D 手部轨迹与相机位姿 — chris_j_paxton · 2026-09-12