新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分

Justgototheeffinmoon · reddit · 2026-07-22

一篇新的 arXiv 论文把一种此前散落在讨论中的风险正式命名为 self-state attacks:AI agent 不是被 prompt injection 直接打穿,而是被它自己读写的 记忆文件、配置文件和状态文件 污染。

论文的核心观点是:自托管 agent 需要通过写入/读取自身状态来工作,因此攻击者可能利用合法的系统调用和文件行为,把恶意内容混进 agent 的状态层。

作者把威胁空间拆成四个维度:

然后把它整理成一个 23 格矩阵,并基于真实自托管 agent 的活动轨迹做了 43 种操作 的测试。

论文结论包括:

论文的工程含义是:只靠操作系统权限控制不够,真正有效的方向可能要上移到应用层完整性校验、canary 记忆项、agent 状态签名等机制。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →