对抗测试拦截提示注入:检索内容不应覆盖系统指令

OpeningBird6240 · reddit · 2026-08-09

开发团队在重构提示词后,文档助手开始赋予检索到的文档内容过高权限。一份包含恶意指令的测试文档成功触发了提示词注入攻击,导致助手将文档内容当作指令执行。

团队依靠发布流水线中已有的对抗性评估(基于 Braintrust)迅速捕获了这一静默回归。通过追踪调用链,他们准确定位了智能体将检索文本视为系统指令的节点。

最终修复方案是重写提示词层级,增加严格的评分器以阻止检索文本覆盖系统指令,并在已知攻击用例通过前阻止合并。核心教训是:必须在系统指令和检索数据之间维持严格的信任层级。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →