21位学者联署白皮书:视觉通用智能能否通向AGI
HirokatuKataoka · x · 2026-10-10
Hirokatsu Kataoka 等 21 位学者(含 Robert Geirhos、Deva Ramanan、Yilun Du、Jiajun Wu、Zhuang Liu、Andrew Davison 等)联合发布 arXiv 白皮书《Visual General Intelligence: A White Paper》,重新从视觉中心的视角审视智能。
核心问题:语言领域 GPT 系列已证明 web 级文本 + 自回归建模 + 激进 scaling 能带来对未见任务的迁移能力;那么从图像、视频、几何等视觉模态中,能涌现哪些能力与智能形态?视觉智能能否作为通向 AGI 的路径(即 VGI)?
论文不试图给视觉智能下单一��义,而是汇聚不同立场与机构的研究者,梳理 AGI 时代计算机视觉应追求的原则、视觉输入模态、benchmark、学习范式,以及以视觉为核心时它与语言等其他模态的关系。
「研究」频道最新
- 开发者发布 Mnemos:受神经科学 engram 启发的 Agent 记忆架构 — RileyRalmuto · 2026-10-10
- LLM 工作流从多语言公民科学评论中采集物种互动观察 — abenitezburraco · 2026-10-10
- Anthropic 新论文:语言模型内部存在可言语化的「全局工作区」 — rgblong · 2026-10-10
- MIT 研究者谈进化搜索:变异只需 1% 有效就能持续进步 — Machine Learning Street Talk · 2026-10-10
- AI 文本检测器对 Meta 新模型改写摘要漏检近 80%,研究警示筛查失效 — rohanpaul_ai · 2026-10-10
- AI 翻译或改变谁能参与学术对话,但小错误可颠倒结论 — yi111 · 2026-10-10