GUI对照题上19个模型最高点中32%,六成到九成点在候选外

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

Md Abrar Jahin, Md Rizwan Parvez

EMNLP 2026 Main Conference

cs.CL

2026-08-22

新基准GUI-Primitives用994道对照题测七种界面空间关系。19个视觉语言模型最高32%点中目标框,60%–92%的点击落在两个候选之外。

这篇在解决什么

计算机使用 agent 的第一步是 GUI grounding:看一张截图,把「Save 右边那个按钮」「Layers 面板里面」落成一个点击坐标。ScreenSpot 和 ScreenSpot-Pro 只问点击有没有落进目标框,OSWorld 还把规划和执行缠在一起。点错了,分不清是空间关系没读懂,还是根本没点到那两个候选上。

GUI-Primitives 把这件事拆成七种最基本的空间关系,做成对照题。截图和锚点固定,只改关系词,正确答案在两个指定候选之间对调。靠「总点最显眼那个」过关的模型,一对里对一题、错一题,成对分数归零。

方法

994 题,497 对,七种 primitive,每种一边 71 题,双候选参照水平一律 0.50。七种分成三类:左右、上下是方位;里面/外面是拓扑;同行同列、最近最远、列表第几、可见/被挡住是布局。

来源拆两路。真实桌面截图 290 张,来自 UI-Vision 的 Web、macOS、VS Code、Office 和专业软件标注,覆盖左右、上下、对齐、远近,外加 24 道从真实菜单挖出来的列表序数。合成 704 张,用程序渲染,位置和干扰项可控。包含和遮挡只能走合成,因为真实 GUI 数据几乎没有可用的父子或遮罩元数据。253 对里,动词和中心名词也会换,避免模型只背关系词。

五名标注员独立看了分层抽样的 196 题。完好性 Fleiss \(\kappa=0.94\),选目标 \(\kappa=0.79\)。多数判定无效的 11 题丢掉,剩下 185 题人类干净子集,标注员在两个候选里选对的比例是 96.9%。这是二选一正确率,和模型的无约束点选不是同一套协议。

测了 19 个视觉语言模型,贪婪解码。主指标跟 ScreenSpot-Pro 一样:预测点是否落在目标框里。因为模型吐的是任意坐标,他们把每次预测再标成目标、干扰项、两者皆非、无效。封闭 API 会在服务端缩小图,他们先把长边缩到已知尺寸,再把坐标映射回原图像素。

另外测了三种免训练干预:在两个指定候选上叠 Set-of-Mark(SoM,给区域编号,让模型选编号而不是回归像素)、点明关系的思维链、以及在 Qwen2.5-VL-7B 第 12 到 19 层残差流上加激活转向。SoM 这一路是先知式诊断:候选集合是送进去的,不是模型自己找的。

结果

最强的 Claude Opus 4.7 全量 31.3%,干净子集 32.4%。GPT-5 全量 26.5%。Qwen2.5-VL-7B 全量 22.0%,在人类核过的 196 题上和 Claude Haiku 4.5 持平(24.5% 对 25.0%)。人类 96.9% 对 Opus 32.4%,差 65 个点。协议并不匹配,但量级差在。

按 primitive 拆开,列表序数是唯一被头部模型做掉的:Claude 家族、GPT-5、Qwen2.5-VL 都在 0.80 到 0.83。左右方向 Opus 到 0.51,刚踩上参照线,其余都在下面。上下最好的是 GPT-5 的 0.32。包含、遮挡、对齐、远近四项上,所有模型的 95% 置信区间上界都低于 0.50。

把 18886 次基线预测按落点分类之后,故事变了。60% 到 92% 的点落在两个候选之外。一旦点进了某个候选,左右、上下、远近的目标选中率是 0.89 到 0.90;包含和遮挡是 0.548 和 0.554,跟 0.50 没有显著差异。主失败是找不到候选。关系词真正失效的,是包含和遮挡。真实截图上 96.2% 的点落在两个候选之外,严格点中框的准确率接近零;合成图上宽松指标能到 0.60 到 0.76,很多错只是差了几个像素。

和 ScreenSpot-Pro 的相关:10 个模型 Spearman \(\rho=+0.74\)(\(p=0.015\))。样本量小,拿掉最强或最弱一个,\(p\) 会升到约 0.07。

SoM 是唯一明显有效的干预:GPT-5 从 30% 到 87%(+57.1),OS-Atlas-Base-7B 从 10% 到 52%(+42.1),Qwen2.5-VL-7B 从 22% 到 57%(+35.1),Opus 从 31% 到 40%(+9.2,Holm 校正后 \(p=0.08\),不显著)。思维链 +0.5 点,激活转向 +1.5 点,都不显著。Qwen 在思维链里已经能说出正确关系,然后照样吐错坐标。Qwen 已经 81% 的列表序数,改成选编号反而掉了 32.4 点。

对照实验也站得住。Qwen2.5-VL-7B 配空白画布从 22.0% 掉到 6.5%,打乱截图掉到 14.8%,重高斯模糊(\(\sigma=12\))只掉到 16.7%,显著但没过预先登记的 10 点线。模型更靠全局布局,不太靠读清标签。

为什么重要

给做计算机使用 agent 的人一条很具体的分工:大多数 primitive 上,模型并不是把「左」理解成「右」,而是连那两个按钮都点不到。包含和遮挡才是关系词本身没信号。免训练的思维链和残差转向补不了这件事。把候选集交出去(检测器、SoM、区域裁剪)能把选择准确率抬几十个点,那是诊断上界,不是可部署方法,上游检测器错了会原样继承。

和 ScreenSpot-Pro 同向,说明这套对照题不是玩具。规模本身填不平:最强闭源模型挤在 24% 到 31%。7B 的 Qwen2.5-VL 能跟 Haiku 打平。

局限与存疑

包含和遮挡只存在于合成臂,那两条「关系词无信号」的结论外推有限。item 级回归在模型固定效应之后,每个 primitive 的系数绝对值不超过 0.07,他们只敢声称模型级相关。下游停在 ScreenSpot-Pro,没有接到 OSWorld 任务成功率。v1 只覆盖英语、静态、点击目标。SoM 最多标两个候选,真实多候选界面未必能复现这 35 到 57 个点。点中框是二值指标,锚点塌缩和方向反转要靠附录里的个案。Llama-3.2-11B-Vision 约 42% 的题目吐默认坐标,准确率 1.2%,这种模型会把「落在候选外」的比例抬高。

左右还不对称:目标在左侧时,点进候选区域的次数约高 2.7 倍;区域内「left of」准确率 0.972,「right of」只有 0.717。论文把它当成频率先验假说,没有做因果检验。

术语

原文与代码

相关论文

全部论文解读