SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng
cs.AI
2026-07-17
给手机 GUI 智能体加一个基于 Qwen3-VL 的安全世界模型,在执行动作前预判后果并拦下危险操作,风险分从 0.347 降到 0.130。
手机上的 GUI 智能体和沙箱里的不一样:它在真实界面上点真实按钮,一次错点可能就是一笔误购、一次隐私外泄、一次数据删除。已有的安全机制大多是反应式的,要么在指令层过滤,要么等执行完再核对,缺的是在动作落地前判断「这一下会不会把状态带进不安全的地方」的能力。这篇把这种能力叫 consequence-aware safety(后果感知安全)。
SeerGuard 是两段式。第一段在交互开始前做指令层筛查,判断用户指令本身是不是带恶意,优先高召回。第二段是动作层风险评估:在智能体每次要执行动作前,用一个安全增强的世界模型(SAWM)预测这个动作会带来什么语义后果,再决定放不放行。
世界模型这里有个关键取舍:它不生成未来的像素级屏幕,而是预测下一状态的语义文本描述,公式上是对隐状态求和的边缘化。SAWM 在 Qwen3-VL-8B-Instruct 上做监督微调,训练数据三层:5.9 万条通用文本安全数据、对 MobileWorld 轨迹重标注的多模态手机风险数据、覆盖 100 个 App 的合成桥接数据,整体安全与不安全比 2:1。
在 MobileSafetyBench(250 个任务,150 高危 100 低危)上,给 Qwen3-VL 套上 SeerGuard 后,风险分(Risk-Cost Score)从 0.347 降到 0.130,安全效用分(Safety-Utility Score)从 0.191 升到 0.596。
| 主干 | 指标 | 加 SeerGuard 前 | 加 SeerGuard 后 |
| Qwen3-VL | 风险分 | 0.347 | 0.130 |
| Qwen3-VL | 安全效用分 | 0.191 | 0.596 |
| GPT-5.1 | 风险分 | 0.301 | 0.145 |
动作层风险评估上,SAWM 在 MobileRisk 上 F1=0.723、Step Score=0.361,优于 OS-Sentinel(0.695/0.269)和 MobileWorld(0.594/0.269)。下一状态 QA 预测准确率 0.762,超过 GPT-5.1 的 0.727,但低于人类的 0.832。提示注入场景下 SAWM 的 F1 到 0.922。
把安全检查从「事后补救」挪到「事前预判」,这个思路对任何要落地到真实环境的智能体都直接可用。关键是它只预测语义后果、不重建整个屏幕像素,计算成本和延迟都低得多,8B 的尺寸也意味着能在端侧或低算力场景跑。对做 Agent 安全和产品化的人来说,这是一个能接入现有 GUI 智能体流水线的模块,不必重训整个策略。
作者承认,在细粒度任务上仍有漏报、在良性任务上仍有误拦,不同类别上增益参差,效果强依赖主干模型自身的规划行为。读下来还有两点要存疑。一是评测指标 RCS 和 SUS 本身是加权聚合,权重参数的选择会直接影响数字好看与否,换一组权重结论可能不同。二是「预测后果」依赖世界模型对环境动力学的建模质量,MobileSafetyBench 这类受控基准里的状态转移相对干净,真实手机 App 的状态空间要混乱得多,迁移效果存疑。安全效用分在 GPT-5.1 上加 SeerGuard 后从 0.703 掉到 0.668,说明拦危险的同时也误伤了正常任务,这是个真实的代价。