27B 开源 GUI agent 追平 GPT-5.5:一条演示把成功率从 17.2% 抬到 35.4%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

cs.AI, cs.CV

2026-08-17

腾讯 UI-Mate-27B 用环境接地的数据引擎(任务-环境-验证器闭环 + 能力树再平衡 + SFT/在线 RL)把 OSWorld-Verified 做到 77.0%,并把演示当子任务级工作流喂进上下文,33 个自演示任务上严格成功率 17.2%→35.4%。

这篇在解决什么

GUI agent(看屏幕、动鼠标键盘干活的 agent)卡在两个瓶颈上。训练侧:轨迹数据离不开可执行环境,但数据生产天然偏向便宜的短任务、单应用任务,长程跨应用工作流和错误恢复始终稀缺。交互侧:用户指令说得出结果,说不出过程。日常工作流被个人工具、文件组织、命名习惯塑形,把这些全写进 prompt 的成本不亚于自己动手,于是用户只给简短指令,细节靠 agent 猜。猜对了的成功率和不靠猜的成功率,均值上看不出差别,只有后者才敢托付。

UI-Mate 的答案是把两边一起做:训练侧上环境接地的闭环数据引擎,交互侧上把录屏演示转成子任务级工作流喂进上下文。

方法

训练栈是一个闭环:任务生成与环境构造(应用、文件、初始状态)、agent rollout、无效轨迹过滤、能力覆盖诊断,再回头指导下一轮任务构造。能力树按「应用 × 操作 × 工作流」细粒度登记覆盖情况,数据按能力缺口分配而非按应用粗粒度采样。产出两样东西:验证过的轨迹给 SFT,可执行的任务-验证器捆包给在线 RL。消融显示能力感知采样让 Multi-App 任务成绩提升 15.5 个点。

交互侧的 DemoCUA 是关键设计。录屏演示不被当成动作序列回放,而是拆成有序子任务,每个子任务带目标、可验证的完成判据、动作描述(纯文字加视觉线索,不带像素坐标)。执行时实时截图说了算:agent 只看到当前子任务的详细步骤和全部子任务的进度清单,截图满足完成判据才发 subtaskcomplete 推进指针。演示是先验不是目标,录屏里引用的元素可能不存在,正确动作由眼前屏幕决定,观察对演示有否决权。

评测用新基准 OSWorkerBench:100 个跨应用办公任务,覆盖 41 个规范化应用、10 个职业族,平均 3.26 个应用每任务,评估器由 113 个检查点构成(平均 4.86),验证终态功能而非轨迹相似度。100K 种子视频式的人工审核加评估器变异测试(初始态必须 0 分、金标准完成必须 1 分)把关。

结果

基准UI-Mate-27B对照
OSWorld-Verified77.0%GPT-5.5 78.7%、Claude Sonnet 5 81.2%、Kimi-K2.6 73.1%、Qwen3.6-27B 底座 52.5%
WindowsAgentArena66.2%GPT-5.5 70.4%、Kimi-K2.6 63.3%、ScaleCUA-9B 38.1%
OSWorkerBench 严格成功41.0%Kimi-K2.6 40.67%、底座 23.33%
OSWorkerBench 进度分76.86%底座 52.35%

同底座同参数量,训练栈贡献 17.7 / 24.5 个点。9B 版更夸张:从底座 Qwen3.5-9B 的 5.05% 成功、18.11% 进度抬到 34.00% / 66.55%。

演示引导的成对对照(同指令、同初始环境、同预算、同评估器,只差有无演示):

评测集无演示一条自演示
OSWorld 子集 30 任务40.27%65.75%(+25.48)
OSWorkerBench 子集 33 任务严格成功17.17%35.35%(+18.18)
OSWorkerBench 子集进度分67.85%81.14%(+13.29)

GameDev 上演示还把平均轨迹从 303.6 步缩到 253.1 步(-16.6%),分数反升 4.39 个点:省掉的是探索性弯路,不是完成度。

训练侧两个反直觉发现。历史推理(把先前步骤的思考链留在上下文里)只在推理期开,给 SFT 模型 +3.43、RL 模型 +2.27 个点;放进 RL 训练反而催生熵坍缩,探索被锁死,评测成绩下降。LLM 审计发现约 18% 通过执行一致性检验的评估器仍然错位(过严匹配 40%、空洞断言 23%、查错目标 19%),奖励有效性才是合成可验证任务的真正约束。

为什么重要

对部署 GUI agent 的团队,这篇给出的信号是:开源 27B 已经贴住闭源第一梯队,GPT-5.5 在 OSWorld 上只领先 1.7 个点。演示引导则指出一条不用改模型的可靠性路径:与其把程序细节写满 prompt,不如录一次屏。UI-Mate App 把这个循环做成了桌面产品,macOS 上原生 Swift 桥接,中位每步 3.03 秒(模型调用 2.11 秒)。

对训练数据工程,能力树再平衡和评估器审计是可迁移的方法论:前者治「数据多但偏」,后者治「奖励对不上指令」。

局限与存疑

演示增益主要在自演示设置(同一任务的强 agent 成功轨迹)下量化,45 个变体演示(人类录的相关但不同任务)只做了 10 任务试点,系统评测留给未来工作,而那才是「教程序性知识」更现实的场景。OSWorld 子集 30 任务是挑的 UI-Mate 无演示失败、强 agent 能解的任务,有选择偏置。演示收益有反例:OSWorld 上 4 个任务分数下降,说明录屏流程被误套到当前界面时是有害的。变体演示还涉及把用户桌面录屏喂给模型的隐私边界,论文没讨论。DemoCUA 当前实现把工作流钉在上下文开头,每次子任务推进都让共享前缀失效,KV cache 复用率低,作者自己承认这是待修的工程债。

术语

原文与代码

社区讨论

相关论文

全部论文解读