An Exam for Active Observers
Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger
cs.CV, cs.AI, cs.CL, cs.LG
2026-07-18
人看东西是边看边调整目光的闭环,但多模态模型只编码一次图像。新基准 ActiveVision 用 17 个任务逼模型反复看,GPT-5.5 仅 10.6%、人类 96%,11 个任务模型零分。
人看东西不是拍一张定帧就完事,目光会跟着中间假设不断重定向:看一眼猜一下,再针对性看下一眼。几十年的心理物理和认知研究都说这种「主动观察」对一大类任务是必需的。但今天的多模态大模型是被动的感知者,图像被一次性编码成固定的一串视觉 token,没有「感知-动作」闭环。现有 benchmark(MMMU-Pro、CharXiv)已经趋近饱和,也根本不测模型能不能在推理展开的过程中反复回到图像上核验。这篇就是要把这块补上。
ActiveVision 有 17 个任务,分三类:
设计原则是每个任务都带「判别性视觉状态」,其信息量超过任何一句语言描述能无损承载的量,逼模型反复看,因为压成语言就丢信息。题面用程序化脚手架生成几何,再用 GPT-image-2 渲成照片级真实图,共 85 题。
| 模型 | 得分 |
| 人类(N=3) | 96.1%(81.7/85) |
| Gemini 3.5 Flash | 8.2% |
| GPT-5.5(xhigh) | 10.6% |
| Gemini 3.1 Pro | 5.9% |
| Claude Fable 5(max) | 3.5% |
| Claude Opus 4.8(max) | 2.4% |
GPT-5.5 在 17 个任务里 11 个零分。把 GPT-5.5 的推理强度从 none 拉到 xhigh,成本涨 100 倍,准确率只从 2.4% 到 10.6%;给 Fable 5 每题多花 31 倍预算也没变准。
作者还测了让模型自己写跑视觉代码:Claude Code(Fable 5)涨到 50.6%、Codex(GPT-5.5)37.6%,但收益集中在属性迁移类,遍历类对全部 agent 都是死局,三个 agent 在「纠缠环计数」上全部零分。而且这种代码在真实图像上不稳,发现它错了本身又需要模型缺的那套主动感知。
它给「前沿模型还差什么」提供了一个干净、还没饱和的新坐标。在大多数推理和编码榜单上领先的 Fable 5,在这里只有 3.5%,远落后于普通人,说明被动编码图像这条路在需要反复看的任务上撞了墙。对做模型和做应用的人,这是提醒:放射(30% 漏诊的肺结节从未被注视)、质控、连接组学这些「专业能力很大程度上就是知道往哪看、怎么看」的场景,现在的多模态模型还顶不上去。
图是 GPT-image-2 按受控提示合成的照片级图,不是自然样本。作者承认外部效度落在扫描、追踪、比对这些基本操作上,而不是渲染本身。随着模型描述图像的能力变强,任务可能被语言捷径绕过,未来得收紧。工具增强那部分测的是「调度工具做视觉解题」,不是纯视觉,专门的 agentic 评测留给以后。85 题规模偏小,人类只有 3 人,统计上单点。另外作者把它说成测量学警告很诚实,但「主动观察」这个构念本身能否被这 17 个任务充分捕捉,也还可以争。