实测10个开源提示注入检测器:默认阈值偏差百倍,健康检查形同虚设

rudra-sh · reddit · 2026-10-01

作者用「真实 agent 遭遇攻击」的方式测试了约 10 个开源 prompt-injection 检测器:不是干净的「ignore previous instructions」字符串,而是把同样的攻击埋进普通工具输出、账单、邮件、网页里,跑了几百个真实攻击加大量正常流量。

最惊人的发现不是弱模型,而是一个好模型在默认阈值下的表现:

更该让上线者警惕的:

生产环境实用建议:

作者最后提问:做注入检测的人是在自己数据上调阈值,还是直接用模型自带默认值?如何持续确认它还在抓、而不只是还在跑?

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →