DeepMind 联合哈佛斯坦福发文:视觉 AI 或是通往 AGI 的路径
rohanpaul_ai · x · 2026-09-12
Google DeepMind 与哈佛、斯坦福等多个顶级机构合作发表的论文提出:通往 AGI 的一条可能路径是「会思考的视觉 AI」——构建能记忆变化、预测结果并采取行动的世界模型。
核心观点:
- 当前多数多模态 AI 只把视觉当作喂给语言模型的输入,论文主张让视觉本身承担更多「思考」
- 有能力的视觉系统应直接从图像、视频、3D 结构与交互中学习:理解什么存在、什么变了、什么被隐藏、接下来可能发生什么、行动前该看哪里
- 视频生成、重建、持久记忆、持续学习、多模态感知和机器人可能是同一系统的组成部分
- 评价标准应转变:不要再用图像问答、描述或逼真视频来评判视觉 AI,而应看它能否从视觉经验中学习世界结构、持续更新知识并用其预测与行动
所属事件:DeepMind 联合哈佛斯坦福:视觉智能或是 AGI 路径(2 条相关)→
「漫话AGI」频道最新
- Anthropic 安全团队成员 Joe Benton 离职:从外部推动 AI 透明与问责 — JacquesThibs · 2026-09-12
- NYT 长文呼吁全球暂停 AI 研发:「AI 已失控」的氛围转变正在发生 — DavidSKrueger · 2026-09-12
- OpenAI 前员工离职后发声:AI 灭绝人类的风险是真实的 — DavidSKrueger · 2026-09-12
- 「AI 灭世」被高估了:更可能的是极权、灾难与经济崩溃 — dbasch · 2026-09-12
- AI 安全研究者拆解 p(doom):不灭世的世界只有两种走法 — DavidSKrueger · 2026-09-12
- 对齐研究被批沦为「向美国对齐」,无视 AI 对环境的适应性 — repligate · 2026-09-12