下一张截图当老师:GHD 让 GUI 智能体在 AndroidLab 涨 11 个点

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

cs.CV

2026-08-06

GHD 训练时让看下一帧的老师纠正只看当前画面的学生,推理时零额外开销;在两个基准上一致超过 GRPO,AndroidLab 涨 11 到 17 个点。

这篇在解决什么

手机 GUI 智能体靠看屏幕、点按滑动来完成任务。因为在线训练又慢又脆,还容易产生不可逆的副作用,主流做法是离线训练:把人类或专家跑出的成功轨迹拆成「当前画面 → 该做的动作」配对,让模型学着模仿。问题在于,这种拆法把动作发生后的下一帧丢掉了,而恰恰是这一帧常常藏着「为什么该点这个」的理由。

论文里有个直观例子:要在某编辑器里开启 Soft Wrap,正确的动作是点 Edit 或 View 菜单,但在菜单展开前,屏幕上没有任何线索指向这两项,证据要等菜单弹出来才出现。标准模仿学习只拿「点 Edit」这个动作标签监督模型,既没监督它该怎么推理,当前画面里也没有可供推理的证据。结果是模型可能蒙对动作,却说不清道理;遇到需要应用知识的导航步骤,干脆学不会。作者把这叫「未来依赖」问题(future-dependence):动作只能从过去预测,但解释动作的证据只在未来出现。

方法

GHD(Gated Hindsight Distillation,门控后见蒸馏)的思路一句话:训练时让老师看到下一张截图,把它当成特权信息(privileged information),再把老师据此修正的推理蒸馏给只看当前画面的学生;推理时老师、未来画面、门控统统丢掉,只用学生。

具体分三块。

参数共享的师生结构。 老师和学生共享同一套参数,老师唯一的优势是输入里多了一张下一步的截图。对学生在当前画面采样出的每条响应,把它的 token 接到老师上下文里做 teacher forcing,老师在每个位置给出一个概率分布。关键设计是:老师和学生在同一份(可能并不完美的)学生前缀上算分布,所以老师给的是沿学生自己生成路径的逐 token 修正,顺着学生已有的生成走,而不是另起一段重新解码。

为什么未来能帮上忙。 作者用概率视角解释:从先验 p(z|s) 回答「现在该做什么」时模型不确定、爱犯错;从后验 p(z|s,s′) 回答「刚才一定做了什么」时,结果已经摆在眼前,近乎确定。从后验里抽出的推理就是缺失的监督信号,一旦写下来就成了显式训练目标。应用知识被明说出来,不再隐含在动作标签里。

门控,只蒸馏有用的。 未来信息只有在老师能正确解读时才有价值,所以蒸馏要设门槛:一条响应被选中,必须同时满足两个条件,只看当前画面的学生做错了,而且看到下一帧的老师把正确动作恢复了。这把含糊的转移、不可靠的解释挡在学生的监督之外。门控用的判据和强化学习的奖励验证器是同一套(坐标容差 δ=20,动作类型与参数匹配)。

训练目标是 GRPO 强化损失加上一个蒸馏损失项(权重 λ=0.1),蒸馏项用对称的 Jensen–Shannon 散度,只在 top-K(K=100)token 上算。再配一个动态采样:一批里如果挑不出「学生错、老师纠正」的样本,最多重采三次,平均用 2.69 次。

结果

主对照(Table 3,三次独立运行取均值)在 AndroidWorld(下称 AW)和 AndroidLab(下称 AL)上比 SFT、GRPO、GHD,两个底座共用同一份 SFT 初始化:

底座基准SFTGRPOGHD
Qwen2.5-VL-7BAW Pass@146.5547.1352.73
Qwen2.5-VL-7BAL Pass@129.7131.9343.10
Qwen3-VL-8BAW Pass@159.0561.3566.47
Qwen3-VL-8BAL Pass@139.1337.4354.11

GHD 相对 GRPO 的提升在 7B 上是 AW +5.6、AL +11.2,8B 上是 AW +5.1、AL +16.7。AndroidLab 的涨幅明显更大,正是那些需要应用导航知识、隐式前置条件的难点。

横向比(Table 1,各自原始设置),GHD 在「开源数据」这一档的两个规模上都拿到最佳平均 Pass@1(7B 47.9,8B 60.3)。它并非全场第一:UI-Venus-1.5-8B、MAI-UI-8B、MobileAgent-v3.5-8B 在 AndroidWorld 上更高(73.7、70.7、71.6),但它们属于「开源权重、不开数据」一类,训练数据和算法各不相同。作者强调这张表看的是整体竞争力,不是隔离 GHD 的贡献。

消融(Table 2,从 GRPO 出发,7B)把功劳拆开:只加门控 +0.71,再加动态采样到 +2.43,最后把老师接到下一帧上,贡献最大的一跳 +3.17,合到 52.73。大部分提升来自把未来信息转成 token 级监督,与多给几次采样机会无关。另一组消融(Table 4)更直白:给老师看标准答案动作或标准推理,几乎不涨甚至略掉(−0.43、+1.29),只有给下一帧才大涨(+5.62)。决定性的是未来画面本身,不是参考答案。

为什么重要

对做 GUI 或 computer-use 智能体的人,这是一条便宜且正交的训练增益:不改模型结构、不增加任何推理开销(部署时只有那个只看当前画面的学生),纯靠重新利用离线轨迹里本来就被丢掉的未来帧。它和现有的数据合成、强化学习方法是叠加关系,并不替代谁。

更值得借鉴的是它指出的诊断。离线轨迹训练里普遍存在的「prefix-action」拆法本身就有信息损失。任何用成功轨迹做行为克隆或强化学习的智能体任务,只要存在「动作的对错要事后才看得清」的步骤,都可能套这个思路:拿未来当训练时的特权,推理时不要它。

局限与存疑

论文没有单列局限章节,作者只在正文里零散承认了几点。训练只跑了 200 个优化步,强化学习预算很小;为省算力把截图压到 420×896(约省 3× 视觉 token),代价是初始 SPT 分数比公开的 OpenMobile 检查点低;效率结论里「动态采样没明显增加训练时间」是基于非独占的租用显卡,作者自己也说这只是参考性观察,不是受控的系统对比。

读下来另有两点存疑。其一,GHD 的提升集中在 AndroidLab,而 AndroidWorld 上相对 GRPO 的增量温和(约 5 个点),说明它在「证据藏在未来」的硬步骤上最值钱,对证据就在眼前的简单步骤增益有限。其二,门控阈值(成功奖励 τsucc=1.45、坐标容差 δ=20)是固定的超参,论文没给敏感性分析,换个任务域这些阈值未必最优。

术语

原文与代码

相关论文

全部论文解读