SeerGuard 用世界模型提前拦截移动 GUI Agent 风险动作
Xue Yu · hf · 2026-07-22
- 论文提出 SeerGuard,这是一个面向移动 GUI agent 的“后果感知”安全框架。
- 它把 执行前指令筛查 和 动作级风险评估 结合起来,尽量在 agent 真正点击/操作前预测后果。
- 作者还通过多任务学习构建了统一的 安全增强世界模型(SAWM),把下一状态预测和安全风险评估合在一起训练。
- 在 Qwen3-VL-8B-Instruct 上,ω=0.8 时 safety-utility score 从 0.191 提升到 0.596;α=0.8 时 risk-cost score 从 0.347 降到 0.130。
- 论文强调,这套方法能泛化到多种移动 GUI agent,且指令筛查与动作风险预测都对效果有贡献。
「编程与Agent」频道最新
- 团队级 AI Agent 落地难题:共享上下文和任务协调放哪里? — Al_Grigor · 2026-09-11
- MCP 链式调用无回滚:agent 工程的真实痛点 — agentrsdg · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11