ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
Kaixin Li, Ziyang Meng, Hongzhan Lin, Ziyang Luo, Yuchen Tian, Jing Ma, Zhiyong Huang, Tat-Seng Chua
cs.CV, cs.HC, cs.MM
2025-04-04
NUS 与港浸会提出 ScreenSpot-Pro:23 款专业软件、1581 张全屏高分辨率截图。现有 GUI 定位模型最高 18.9%;用 GPT-4o 规划再级联搜索的 ScreenSeekeR,无额外训练把 OS-Atlas-7B 抬到 48.1%。
GUI Agent 要替人点软件,先得把自然语言指令落到屏幕上的某个控件。这个动作叫 GUI grounding,输出通常是一个点或一个框。现有评测大多停在网页、手机 App,或者把全屏裁成局部再测。SeeClick 的 ScreenSpot 就是后一种:示例图经常只有 960×540,目标平均占画面 2.01%。
专业软件不是这个尺度。Photoshop、AutoCAD、SolidWorks、MATLAB、VS Code 默认跑在 1080p 以上,双屏很常见;菜单密、图标小,旁边还开着文档和辅助窗口。新加坡国立大学、华东师范大学、香港浸会大学把评测拉回真实全屏,放出 ScreenSpot-Pro:1581 条指令、1581 张互不重复的高分辨率截图,覆盖 23 款应用、6 类场景,以及 Windows、macOS、Linux。目标平均只占画面 0.07%,相对面积大约是 ScreenSpot 的 1/29。
分辨率一高,相对目标就变小。图 2 在 ScreenSpot-v2 上已经画出同一条曲线:框越小,SeeClick、OS-Atlas、UGround、Qwen2-VL 准确率一起掉。专业界面再叠外部工具窗口,模型即使读懂指令,也很难点到正确像素。
基准本身是这项工作的主体。标注者都是对应软件五年以上的使用者,按日常流程操作。后台有一个静默截屏工具,快捷键弹出当前画面,当场画框、写指令,避免事后回忆走样。分辨率优先大于 1080p,关闭系统缩放;双屏就一张图横跨两台显示器。图 1 显示 2560×1440 约占样本的 32.4%。每条样本至少两人复核,歧义指令改到只对应一个目标,框只包可交互区域。目标分成 text 和 icon:旁边带文字标签的一律算 text,纯图标才算 icon。中文指令由 GPT-4 翻译、作者校对,每条任务双语各一份。
方法上的观察很直接:缩小搜索区域,准确率就会涨。三条不需要规划器的基线共用 OS-Atlas-7B 做 grounder。
ScreenSeekeR 把缩小搜索做成带规划器的视觉搜索。GUI 有层级,菜单和属性通常待在子面板里。GPT-4o 当 planner,自己直接 grounding 只有 0.8%,它的任务是根据截图推断目标大概在哪、旁边还可能有哪些控件,「新建」旁边常常是「删除」。grounder 在候选区域里打框,小框先膨胀以免漏掉,再按框中心到候选区中心的距离打分(σ=0.3),NMS 去掉重叠,按分数递归裁进去。子图短边够小(超参设为 1280 像素)才让 grounder 出最终框,planner 再确认。全程不加训练。
端到端模型在这套全屏专业界面上集体掉线。
| 模型 | 平均准确率 |
| OS-Atlas-7B | 18.9% |
| UGround-7B | 16.5% |
| Aria-UI(3.9B 激活) | 11.3% |
| ShowUI-2B / CogAgent-18B | 7.7% |
| SeeClick-7B | 1.1% |
| GPT-4o | 0.8% |
其余模型没有一家平均超过 10%。OS-Atlas-7B 文本 28.1%、图标 4.0%;按场景拆,Office 27.4%,CAD 只有 10.3%。图标难,是因为专业软件功能太多写不全文字、默认用户认得图标,而这些图标几乎不出现在网页预训练数据里。
换中文指令更差。OS-Atlas-7B 掉到 16.8%;UGround-7B 从 16.5% 掉到 7.7%。
缩小搜索区域立刻见效,grounder 仍是 OS-Atlas-7B:
| 方法 | 文本 | 图标 | 平均 |
| 直接定位 | 28.1 | 4.0 | 18.9 |
| Iterative Zooming | 43.5 | 10.8 | 31.0 |
| Iterative Narrowing | 43.5 | 13.1 | 31.9 |
| ReGround | 55.7 | 15.1 | 40.2 |
| ScreenSeekeR | 64.1 | 22.4 | 48.1 |
无规划器里最简单的 ReGround 反而是最强。ScreenSeekeR 再加约 8 个点,到 48.1%,是基线的 2.54 倍。去掉递归、只留 planner 第一次决策,掉到 41.9%;去掉邻居推断 46.4%;打分改成简单多数投票 46.8%。Office 上 ScreenSeekeR 到 64.3%,CAD 仍只有 37.9%。图标从 4.0% 抬到 22.4%,仍远低于文本的 64.1%。
还在 ScreenSpot 那种局部裁图上刷分,分数会偏乐观。真实专业软件是全屏、高分辨率,目标只有画面的 0.07%。现成 7B grounding 模型直接上,正确率过不了两成;GPT-4o 几乎点不准。
能马上用的不是再训一个 grounder,是搜索策略。ReGround 只多一轮裁块重定位,就把 OS-Atlas-7B 从 18.9% 拉到 40.2%。ScreenSeekeR 进一步说明:不会点坐标的强规划器,仍然能靠界面常识缩小搜索范围。代价是多轮视觉调用和 GPT-4o API,延迟和费用都会上去。
评测对齐了真实桌面,方法是训练免费的搜索。想做 Photoshop、CAD、MATLAB 自动化的团队,应该先在这套榜上测,不要只看网页和手机数字。
论文写明:这套基准只测 grounding,不测规划和执行。专业软件授权风险在,没法做成 OSWorld 那种端到端环境。点对了不等于任务能跑完。
即便 ScreenSeekeR,平均也才 48.1%,图标 22.4%,CAD 37.9%,离能替人点专业软件还差一截。规划器绑死 GPT-4o,消融没有换更弱的开源 planner,成本敏感场景能不能复现这 48.1% 是未知数。中文指令下最强模型只有 16.8%,中文工作流几乎没被现有模型覆盖。
1581 条能否覆盖 23 款软件的长尾功能、双屏样本占比多少,正文没有更细的分层表。ReGround 已经 40.2%,ScreenSeekeR 多出来的 8 个点有多少来自 GPT-4o 的贵推理、多少来自多轮裁图,也没有按调用次数和费用拆开。