21位学者联署白皮书:视觉通用智能能否通向AGI

HirokatuKataoka · x · 2026-10-10

Hirokatsu Kataoka 等 21 位学者(含 Robert Geirhos、Deva Ramanan、Yilun Du、Jiajun Wu、Zhuang Liu、Andrew Davison 等)联合发布 arXiv 白皮书《Visual General Intelligence: A White Paper》,重新从视觉中心的视角审视智能。

核心问题:语言领域 GPT 系列已证明 web 级文本 + 自回归建模 + 激进 scaling 能带来对未见任务的迁移能力;那么从图像、视频、几何等视觉模态中,能涌现哪些能力与智能形态?视觉智能能否作为通向 AGI 的路径(即 VGI)?

论文不试图给视觉智能下单一��义,而是汇聚不同立场与机构的研究者,梳理 AGI 时代计算机视觉应追求的原则、视觉输入模态、benchmark、学习范式,以及以视觉为核心时它与语言等其他模态的关系。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →