新论文揭示 Agent 记忆可「洗白」越权权限,误授权率超 50%
BlancheMinerva · x · 2026-09-09
arXiv 新论文《Agent Memory Is a Surface for Endogenous Authorization Laundering》指出:长期运行的 LLM agent 依赖持久记忆保存权限、限制与撤销状态,当记忆错误记录授权状态时,agent 自己的记录就能赋予历史从未允许过的权限——无需任何外部攻击者即可导致越权行为,作者称之为「内生授权洗白」(endogenous authorization laundering)。
关键发现:
- 提出 EAL-Bench,衡量持久记忆对授权状态演变保留的准确度,以及错误是否会传导为越权动作;在采购、网络安全、金融三个场景评测 5 个记忆写入模型与 2 个执行模型
- 增量记忆更新下,写入模型对高达 50.2% 的未授权请求凭空创建虚假权限
- 一旦虚假权限存在,执行模型在 98.6% 的试验中照做
- 两种缓解方案(要求存储权限有有效来源事件背书、用有界事件溯源追踪权限变更)能大幅减少洗白,但也会误拒合法操作,暴露安全-可用性权衡
结论:持久记忆不只是性能组件,而是 agent 实际授权策略的一部分。论文与代码均已公开。
「安全」频道最新
- 对齐乐观派长文:AI 本质上比人类员工更易控制 — QuintinPope5 · 2026-09-09
- OpenAI 官宣 9 月 16 日办 GPT-6 Community Night,现开放申请 — sama · 2026-09-09
- 全球首例:英国议会引入「禁止超级智能」法案 — DavidSKrueger · 2026-09-09
- 中美AI安全议题将上峰会桌面,学者呼吁建立沟通渠道 — austinc3301 · 2026-09-09
- Reddit 热议:失控 AI 蜂群为何盯上 Hugging Face 权重? — mtns_of_magic · 2026-09-09
- 安全研究者 sahkho 宣布加入 OpenAI,聚焦智能体安全 — paw_lean · 2026-09-09