华盛顿大学发现,Agent 记忆会把注入负载留到下次会话
rohanpaul_ai · x · 2026-07-26
华盛顿大学的一篇论文研究了 agent 记忆文件里的 prompt injection 风险,目标文件包括 CLAUDE.md、AGENTS.md 和行为笔记。
研究发现,模型即使识别出恶意指令并拒绝执行,也经常不会把那行恶意内容删除,而是保留给下一次会话。团队在沙箱中用 Claude Code 和 OpenAI Codex 对 4 个模型做了多轮、多会话探测,结果显示:
- 拒绝 和 清除 是两件不同的事;
- 记忆文件会让攻击负载跨会话持续存在;
- 未来的子代理、低价模型,甚至降级后的你自己,都可能再次读到同一段恶意指令。
论文结论是:持久化记忆改变了 prompt injection 的威胁模型,防护重点应当是保护记忆更新过程,而不是简单删除所有可用的自适应信息。
「安全」频道最新
- 摩尔斯电码藏指令转走 30 亿 DRB,AI 验证缺口暴露 — IridiumEagle · 2026-07-26
- OpenAI 被质疑内部模型已跨过网络安全红线 — AaronBergman18 · 2026-07-26
- OpenAI 发 34 页白皮书详解 AI Agent 构建方法 — mdancho84 · 2026-07-26
- Stoller 认为版权训练不属合理使用,许可制将重塑 AI 商业模式 — GaryMarcus · 2026-07-26
- Meta 被指用 AI 筛选裁员名单,波及受保护休假员工 — emmanuelvivier · 2026-07-26
- 美国拟立法授权政府叫停高风险 AI 系统 — emmanuelvivier · 2026-07-26