安卓GUI Agent遇运行时陷阱全线掉点,死锁训也救不了

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu, Hong Zhou

cs.AI

2026-08-25

AnTrap在236道安卓任务执行中途注入四层十类扰动。16个GUI模型全部掉点,最强Claude Sonnet 4.6从74.2%落到66.5%;单步状态/动作陷阱对抗训练能补,死锁和循环几乎补不动。

这篇在解决什么

安卓GUI Agent上线会碰到广告弹窗、渲染遮挡、自己点偏、动作用错、界面卡住、来回循环。现有动态基准(AndroidWorld、AndroidLab、MobileWorld)多半在干净环境里考完整执行;偏鲁棒性的工作要么是静态轨迹,要么只覆盖视觉噪声或指令歧义。缺的是:在真实执行环里可控地注入异常,并且保证任务仍可完成,从而单独量恢复能力。

方法

AnTrap从AndroidWorld扩出236道带随机指令的基座任务。分类法STAR按执行环切四层、十类:State(外部打断、视觉遮挡)、Thinking(时序冲突、视觉幻觉)、Action(接地错误、动作类型用错、意图偏离)、Round(状态死锁、上下文打断、循环)。

注入发生在线上执行中途,不是改死一条静态轨迹。State直接改模拟器画面或弹窗;Thinking把错误观察塞进当前步但不写入之后的真历史,让Agent带着自己的幻觉往下走;Action在落地前改坐标或动作类型;Round跨多步劫持流程。两条硬约束:扰动随机落在轨迹上;注入后题目仍可解,掉点只能归到恢复失败。人工核验三项(原题可解、注入后可解、陷阱像真机)通过率91%。指标是规则成功率和相对干净环境的落差,Pass@3。

结果

16个模型在陷阱下平均成功率一律低于干净基线。Claude Sonnet 4.6从74.2%到66.5%,GUI-Owl-1.5-32B-Think从69.5%到62.4%。人在原题94.1%,陷阱下平均仍有93.4%。Round层和外部打断掉得最狠;单步的动作层、视觉遮挡、视觉幻觉相对能扛。带thinking的模型干净分更高,掉点幅度并不更小:Qwen3-VL-8B-Thinking掉6.1分,Instruct版掉5.8分。

模型干净陷阱平均
人类94.1%93.4%
Claude Sonnet 4.674.2%66.5%
GUI-Owl-1.5-32B-Think69.5%62.4%
GPT-5.465.3%56.6%
UI-TARS-1.5-7B29.7%21.8%

在干净环境和AnTrap上分别做GRPO,分界变得清楚。干净环境训练把GUI-Owl-7B原题从63.1%推到69.9%,对陷阱几乎没帮助。按子类做对抗GRPO后,State层绝对提升约8.1到11.0分,Action层最高约8.5分;Thinking层约4到5分;Round层低于3分,Loop严格低于1分。

为什么重要

GUI Agent的公开榜多半是理想路径。弹窗、死锁、循环才是装机后的日常。单步状态和动作错误,可以用带陷阱的环境强化学习补上;跨步的上下文陷阱补不上,说明缺的是长程自我监控,不是再多几条干净成功轨迹。上thinking也不会自动变成恢复能力。

局限与存疑

基座只有236道题,覆盖不了全球安卓场景。没做对抗SFT,而相关工作认为SFT更可能补上下文理解。评测是诊断工具,不是现成训练方案。部分thinking层陷阱对人类不适用,人机对比在那些子类上要打折。GPT系列的接地子类因推理接口限制没有完整数字。

术语

原文与代码

相关论文

全部论文解读