BadWAM:想对了但执行错了
Qi Li · hf · 2026-07-17
BadWAM:世界-动作模型会“想对了,做错了”
这篇论文研究 World-Action Models(WAMs) 的对抗脆弱性。WAM 的卖点是把动作生成和未来世界预测耦合在一起,因此常被认为更稳健、可解释,也更安全;但作者指出,这种“想象-执行一致性”其实很脆弱。
论文提出的攻击
BadWAM 统一描述并评估一类针对 WAM 的 World-Action Drift Attacks:
- action-only attack:优先破坏任务,直接把模型推向失败动作
- imagination-preserving attack:同时追求隐蔽性,让模型表面上仍预测出合理未来,但执行时动作已经偏移
结果
- 在不同 WAM 变体上都能显著降低闭环执行成功率
- 文中给出的例子里,action-only 攻击把成功率从 96.5% 降到 43.1%
- 即使加入一定的未来保真正则,也仍可能维持较强攻击效果
结论是:WAM 的“想得像样”并不等于“做得安全”。
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11