华盛顿大学发现,Agent 记忆会把注入负载留到下次会话

rohanpaul_ai · x · 2026-07-26

华盛顿大学的一篇论文研究了 agent 记忆文件里的 prompt injection 风险,目标文件包括 CLAUDE.md、AGENTS.md 和行为笔记。

研究发现,模型即使识别出恶意指令并拒绝执行,也经常不会把那行恶意内容删除,而是保留给下一次会话。团队在沙箱中用 Claude Code 和 OpenAI Codex 对 4 个模型做了多轮、多会话探测,结果显示:

论文结论是:持久化记忆改变了 prompt injection 的威胁模型,防护重点应当是保护记忆更新过程,而不是简单删除所有可用的自适应信息。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →