开发者分享 Prompt Injection 检测清单:不可信文本是指令,不是数据
blaizedsouza · x · 2026-09-13
一份面向生产环境的 Prompt Injection(提示词注入)检测实战清单,核心场景:RAG 检索回来的网页会试图「变成你的系统提示词」,必须在进入模型上下文前扫描。
六条检测做法:
- 文本进入模型上下文之前先扫描
- 标记「ignore previous instructions」类注入模式
- 隔离被标记的可疑片段
- 对可疑来源优先用抽取式答案而非生成
- 疑似注入时阻断工具调用
- 保留样本供红队使用
核心原则:不可信文本是数据,不是命令。作者还提醒:自己的知识库也可能被投毒,同样要扫描。
(注:原帖带导流关注语,但清单本身有工程实质。)
「编程与Agent」频道最新
- 多智能体对抗互审实验:Claude 与 Hermes 通过对话协商写锁 — seanwbren · 2026-09-13
- 行为反差:Opus 改 5 行写测试写长说明,Sol 提交 5000 行零检查 — rms80 · 2026-09-13
- GitHub Copilot 应用内置三面板,简化 AI 代码验证流程 — WirelessLife · 2026-09-13
- AI Agent 像精灵:不会验收成果,愿望就变猴爪 — SpencrGreenberg · 2026-09-13
- 开源工具 sound-and-vision:一键生成歌曲和音乐视频,完全免费 — LawrenceOfTheLabia · 2026-09-13
- GPT-6 Astra 技能退化账:每月超 200 件交付只需做评审 — AccBalanced · 2026-09-13