PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou
cs.CV
2026-07-28
一个自下而上从 42 个基准的错误里归纳出来的新基准,把视觉感知拆成十项原子能力、3000 道单能力题;16 款前沿多模态大模型没有一个过 60%,最弱的是感知相关幻觉。
现在的多模态大模型(MLLM)基准,要么是「整体打分」型,像 MMMU、MathVista,一道题要推理好几步,最后看答案对不对,分不清错在视觉感知还是推理或者知识;要么是「应用驱动」型,像 OCRBench、ScreenSpot,自上而下按设计者的先验挑了一小块能力来测,覆盖窄、碎。两种都没法把「感知」这一层单独拎出来。这篇要做的,就是一个只考感知、把推理和知识污染剔除干净的基础评测。
做法是自下而上。作者先拿一批前沿 MLLM 跑 42 个现有基准,把它们答错的题收下来,把每条错误归因到推理轨迹里最早出错的哪一步,再聚类成一套错误分类法(五个大类)。其中「感知」这一支定义出十项原子能力。接着按这套分类构造题,最终发布 3000 道经过核验的题,每道只考一项能力、答案短而明确,难度来自感知本身而不是推理或知识。十项能力是:视觉定位、属性识别、计数、关系理解、深度与 3D 感知、OCR、视觉比较、细粒度识别、上下文整合、感知相关幻觉。
16 款前沿 MLLM(开源闭源都有)跑下来,核心结论三条。第一,原子感知远没解决:没有一款模型整体准确率过 60%,排第一的 GPT-5.6-Sol 也只有 59.7%。第二,最弱的能力平均是「感知相关幻觉」。第三,总分接近的模型,能力剖面可以差很远:GPT-5.5 和 Gemini-3.1-Pro 整体只差不到一分(55.8% 对 56.2%),但 GPT-5.5 在定位上领先 13 分,Gemini-3.1-Pro 在 OCR 上领先 8 分;就连总分第一的 GPT-5.6-Sol,定位能到 76.7%,幻觉却只有 26.9%。还有一个反直觉的发现:总分在重复跑之间是稳的,但单题层面的对错并不稳定,相当一部分答对的题并不能稳定复现。
对评测和模型研发都有用。对评测,它示范了一种「把感知从推理里剥离」的方法,提示很多现有基准的高分可能掩盖了感知短板。对研发,最直接的信号是「感知相关幻觉」是当前最该补的洞,而总分接近的两个模型可能在完全不同的能力上各自主导,选模型不能只看总分,得看剖面。它也间接回答了一个从业者关心的问题:模型答错,到底是因为没看清,还是没想对,这个基准给出了能区分两者的工具。
3000 道题、十项能力的粒度,对一个声称覆盖「原子感知」的基准来说还是粗,十项之外是否还有未被覆盖的基本感知能力,论文没讨论。题目是从 42 个现有基准的错误里归纳来的,分类法本身受那批基准的覆盖面限制,可能带有选择偏差。作者也承认单题稳定性有问题(答对的题不一定能复现),这意味着分数背后的可靠性比看上去弱,但论文没有给出一个「可靠性校正」后的排名。另外评测用的模型名(GPT-5.6-Sol 等)是较新的快照,结论会随模型迭代很快过时。