专业软件全屏 GUI 定位,最强模型 18.9%,无训练搜索到 48.1%

ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use

Kaixin Li, Ziyang Meng, Hongzhan Lin, Ziyang Luo, Yuchen Tian, Jing Ma, Zhiyong Huang, Tat-Seng Chua

cs.CV, cs.HC, cs.MM

2025-04-04

NUS 与港浸会提出 ScreenSpot-Pro:23 款专业软件、1581 张全屏高分辨率截图。现有 GUI 定位模型最高 18.9%;用 GPT-4o 规划再级联搜索的 ScreenSeekeR,无额外训练把 OS-Atlas-7B 抬到 48.1%。

这篇在解决什么

GUI Agent 要替人点软件,先得把自然语言指令落到屏幕上的某个控件。这个动作叫 GUI grounding,输出通常是一个点或一个框。现有评测大多停在网页、手机 App,或者把全屏裁成局部再测。SeeClick 的 ScreenSpot 就是后一种:示例图经常只有 960×540,目标平均占画面 2.01%。

专业软件不是这个尺度。Photoshop、AutoCAD、SolidWorks、MATLAB、VS Code 默认跑在 1080p 以上,双屏很常见;菜单密、图标小,旁边还开着文档和辅助窗口。新加坡国立大学、华东师范大学、香港浸会大学把评测拉回真实全屏,放出 ScreenSpot-Pro:1581 条指令、1581 张互不重复的高分辨率截图,覆盖 23 款应用、6 类场景,以及 Windows、macOS、Linux。目标平均只占画面 0.07%,相对面积大约是 ScreenSpot 的 1/29。

分辨率一高,相对目标就变小。图 2 在 ScreenSpot-v2 上已经画出同一条曲线:框越小,SeeClick、OS-Atlas、UGround、Qwen2-VL 准确率一起掉。专业界面再叠外部工具窗口,模型即使读懂指令,也很难点到正确像素。

方法

基准本身是这项工作的主体。标注者都是对应软件五年以上的使用者,按日常流程操作。后台有一个静默截屏工具,快捷键弹出当前画面,当场画框、写指令,避免事后回忆走样。分辨率优先大于 1080p,关闭系统缩放;双屏就一张图横跨两台显示器。图 1 显示 2560×1440 约占样本的 32.4%。每条样本至少两人复核,歧义指令改到只对应一个目标,框只包可交互区域。目标分成 text 和 icon:旁边带文字标签的一律算 text,纯图标才算 icon。中文指令由 GPT-4 翻译、作者校对,每条任务双语各一份。

方法上的观察很直接:缩小搜索区域,准确率就会涨。三条不需要规划器的基线共用 OS-Atlas-7B 做 grounder。

ScreenSeekeR 把缩小搜索做成带规划器的视觉搜索。GUI 有层级,菜单和属性通常待在子面板里。GPT-4o 当 planner,自己直接 grounding 只有 0.8%,它的任务是根据截图推断目标大概在哪、旁边还可能有哪些控件,「新建」旁边常常是「删除」。grounder 在候选区域里打框,小框先膨胀以免漏掉,再按框中心到候选区中心的距离打分(σ=0.3),NMS 去掉重叠,按分数递归裁进去。子图短边够小(超参设为 1280 像素)才让 grounder 出最终框,planner 再确认。全程不加训练。

结果

端到端模型在这套全屏专业界面上集体掉线。

模型平均准确率
OS-Atlas-7B18.9%
UGround-7B16.5%
Aria-UI(3.9B 激活)11.3%
ShowUI-2B / CogAgent-18B7.7%
SeeClick-7B1.1%
GPT-4o0.8%

其余模型没有一家平均超过 10%。OS-Atlas-7B 文本 28.1%、图标 4.0%;按场景拆,Office 27.4%,CAD 只有 10.3%。图标难,是因为专业软件功能太多写不全文字、默认用户认得图标,而这些图标几乎不出现在网页预训练数据里。

换中文指令更差。OS-Atlas-7B 掉到 16.8%;UGround-7B 从 16.5% 掉到 7.7%。

缩小搜索区域立刻见效,grounder 仍是 OS-Atlas-7B:

方法文本图标平均
直接定位28.14.018.9
Iterative Zooming43.510.831.0
Iterative Narrowing43.513.131.9
ReGround55.715.140.2
ScreenSeekeR64.122.448.1

无规划器里最简单的 ReGround 反而是最强。ScreenSeekeR 再加约 8 个点,到 48.1%,是基线的 2.54 倍。去掉递归、只留 planner 第一次决策,掉到 41.9%;去掉邻居推断 46.4%;打分改成简单多数投票 46.8%。Office 上 ScreenSeekeR 到 64.3%,CAD 仍只有 37.9%。图标从 4.0% 抬到 22.4%,仍远低于文本的 64.1%。

为什么重要

还在 ScreenSpot 那种局部裁图上刷分,分数会偏乐观。真实专业软件是全屏、高分辨率,目标只有画面的 0.07%。现成 7B grounding 模型直接上,正确率过不了两成;GPT-4o 几乎点不准。

能马上用的不是再训一个 grounder,是搜索策略。ReGround 只多一轮裁块重定位,就把 OS-Atlas-7B 从 18.9% 拉到 40.2%。ScreenSeekeR 进一步说明:不会点坐标的强规划器,仍然能靠界面常识缩小搜索范围。代价是多轮视觉调用和 GPT-4o API,延迟和费用都会上去。

评测对齐了真实桌面,方法是训练免费的搜索。想做 Photoshop、CAD、MATLAB 自动化的团队,应该先在这套榜上测,不要只看网页和手机数字。

局限与存疑

论文写明:这套基准只测 grounding,不测规划和执行。专业软件授权风险在,没法做成 OSWorld 那种端到端环境。点对了不等于任务能跑完。

即便 ScreenSeekeR,平均也才 48.1%,图标 22.4%,CAD 37.9%,离能替人点专业软件还差一截。规划器绑死 GPT-4o,消融没有换更弱的开源 planner,成本敏感场景能不能复现这 48.1% 是未知数。中文指令下最强模型只有 16.8%,中文工作流几乎没被现有模型覆盖。

1581 条能否覆盖 23 款软件的长尾功能、双屏样本占比多少,正文没有更细的分层表。ReGround 已经 40.2%,ScreenSeekeR 多出来的 8 个点有多少来自 GPT-4o 的贵推理、多少来自多轮裁图,也没有按调用次数和费用拆开。

术语

原文与代码

社区讨论

相关论文

全部论文解读