629 次真实注入攻击实测:Prompt Guard 2 调阈值后从 1% 跃升至 99%

rudra-sh · reddit · 2026-09-28

作者为 AI agent 工具调用构建策略防火墙时,把 AgentDojo 的 629 个注入攻击嵌入真实工具输出(邮件、账单、评论)中,加上 97 条正常输出,本地 CPU 实测 10 个开源注入检测器。

三条经验:1) 永远不要相信检测器开箱默认阈值,要在自己的流量上调优;2) 报告捕获率必须同时报告误报率;3) 只看文本不够,rm -rf /、读 /.ssh/idrsa、curl | sh 这类危险调用根本不是「注入」,最终决策应在工具调用层——检查参数来源和调用后果。全部可复现,仓库 buried-injections 支持 make targets 和一行接入新检测器。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →