629 次真实注入攻击实测:Prompt Guard 2 调阈值后从 1% 跃升至 99%
rudra-sh · reddit · 2026-09-28
作者为 AI agent 工具调用构建策略防火墙时,把 AgentDojo 的 629 个注入攻击嵌入真实工具输出(邮件、账单、评论)中,加上 97 条正常输出,本地 CPU 实测 10 个开源注入检测器。
- 默认阈值下:Jailbreak-Detector-Large 最优,仅捕获 51%、误拦 2%;ProtectAI DeBERTa v2 单独评分可抓全部 27 种攻击文本,混入正常文本后只剩 23%;Meta Prompt Guard 2 (86M) 只抓到 6/629,22M 版抓 0。
- 阈值按「误拦不超过 2% 正常流量」重新调优并跨域测试后排名反转:Prompt Guard 2 未知域捕获率升至 99%(阈值 0.003),而 deepset 从 100% 崩到 0%,Preamble 从 88% 跌到 3%。
- 作者也警告:AgentDojo 所有攻击共用同一模板,微调后的阈值可能只是认出了模板;0.003 也偏脆弱、正常样本仅 97 条。
三条经验:1) 永远不要相信检测器开箱默认阈值,要在自己的流量上调优;2) 报告捕获率必须同时报告误报率;3) 只看文本不够,rm -rf /、读 /.ssh/idrsa、curl | sh 这类危险调用根本不是「注入」,最终决策应在工具调用层——检查参数来源和调用后果。全部可复现,仓库 buried-injections 支持 make targets 和一行接入新检测器。
「编程与Agent」频道最新
- 用 Codex 直接排版 Google Slides:四步工作流省下数小时 — every · 2026-09-28
- 自动化 Newsletter 加 Markdown 广告位,今天上线即出 3 单 — iannuttall · 2026-09-28
- 用 Opus 5.5 做专业动效:先出 3 版分镜,导演式指令逐镜迭代 — sven_ai · 2026-09-28
- NVIDIA 开源 OpenShell:为自主 AI Agent 打造安全私有运行时 — MikkoH · 2026-09-28
- 英伟达联合百余家伙伴推出开放式 Agent 安全平台 — Polymarket · 2026-09-28
- 让 Claude 给自己造了个游戏《F-Stop》,作者直呼震撼 — themayorofbikini · 2026-09-28