警惕:持久化记忆会让 Prompt Injection 变得更危险

jonah_omninode · reddit · 2026-08-28

作者指出了 Prompt Injection 在 Agent 拥有持久化记忆时的隐蔽威胁:恶意的 README、工单或工具响应可能被总结并存储,随后在源文件消失后,作为“已知项目上下文”被重新调用。这种恶意指令实际上被“洗白”进了系统的长期记忆。

设计思路:

作者正在设计一种将上下文视为带元数据对象(来源、版本、权威性)的系统,区分相关性与策略性,防止新备注自动覆盖稳定合同。

局限性:

这并不能完全解决注入问题,因为模型仍可能受无信任来源影响。任何外部操作仍需独立的授权检查。作者正计划测试被污染的上下文能否在检索、总结和多会话合并中存活。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →