MiniLM+逻辑回归做轻量注入检测,对抗基准下 F1 仅 61.6%

Worldly_Yoghurt8850 · reddit · 2026-09-08

作者开源了一个轻量级 prompt injection 检测器,目标是在不依赖另一个大模型的前提下前置过滤不可信输入:

架构:all-MiniLM-L6-v2 嵌入(384 维)→ 逻辑回归 → 二分类(安全/注入),Joblib 打包、无需 GPU。

数据:1130 条训练样本(270 良性 + 860 注入),覆盖直接、间接、混淆、存储型、上下文劫持和工具链攻击;另设 48 条独立持出样本和 227 条冻结的对抗基准(含边界良性、长上下文、引用指令、含注入样文本的代码、多语言等)。

关键发现:在对抗基准上准确率仅 53.3%、F1 61.6%、误报率 66.4%。最大弱点是良性内容一旦包含攻击相关词汇(如讨论「ignore previous instructions」这一技术本身)就会被误判——词汇相似掩盖了意图差异。

下一步:不加模型规模,先补 hard negatives、最小对比对、多语言和长文本分块检测,对抗基准保持冻结以便版本对比。项目与模型、数据集均已开源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →