警惕:持久化记忆会让 Prompt Injection 变得更危险
jonah_omninode · reddit · 2026-08-28
作者指出了 Prompt Injection 在 Agent 拥有持久化记忆时的隐蔽威胁:恶意的 README、工单或工具响应可能被总结并存储,随后在源文件消失后,作为“已知项目上下文”被重新调用。这种恶意指令实际上被“洗白”进了系统的长期记忆。
设计思路:
作者正在设计一种将上下文视为带元数据对象(来源、版本、权威性)的系统,区分相关性与策略性,防止新备注自动覆盖稳定合同。
局限性:
这并不能完全解决注入问题,因为模型仍可能受无信任来源影响。任何外部操作仍需独立的授权检查。作者正计划测试被污染的上下文能否在检索、总结和多会话合并中存活。
「安全」频道最新
- 为何安全控制优于超级智能对齐? — joshua_saxe · 2026-08-28
- AI Agent 或泄露 Git 历史中的敏感信息 — doodlestein · 2026-08-28
- 法官被鼓励使用 AI 摘要引发生态担忧 — LuizaJarovsky · 2026-08-28
- 特朗普半导体关税政策或引发美数据中心危机 — pstAsiatech · 2026-08-28
- AI中风检测落地难,医保编码成关键推手 — import_jmr · 2026-08-28
- AI 检测器误判引法律战,作家起诉诽谤 — rohanpaul_ai · 2026-08-28