MiniLM+逻辑回归做轻量注入检测,对抗基准下 F1 仅 61.6%
Worldly_Yoghurt8850 · reddit · 2026-09-08
作者开源了一个轻量级 prompt injection 检测器,目标是在不依赖另一个大模型的前提下前置过滤不可信输入:
架构:all-MiniLM-L6-v2 嵌入(384 维)→ 逻辑回归 → 二分类(安全/注入),Joblib 打包、无需 GPU。
数据:1130 条训练样本(270 良性 + 860 注入),覆盖直接、间接、混淆、存储型、上下文劫持和工具链攻击;另设 48 条独立持出样本和 227 条冻结的对抗基准(含边界良性、长上下文、引用指令、含注入样文本的代码、多语言等)。
关键发现:在对抗基准上准确率仅 53.3%、F1 61.6%、误报率 66.4%。最大弱点是良性内容一旦包含攻击相关词汇(如讨论「ignore previous instructions」这一技术本身)就会被误判——词汇相似掩盖了意图差异。
下一步:不加模型规模,先补 hard negatives、最小对比对、多语言和长文本分块检测,对抗基准保持冻结以便版本对比。项目与模型、数据集均已开源。
「安全」频道最新
- 黑客组织威胁曝光佛州车管所数据,证据竟涉爱泼斯坦旧档 — TechNadu · 2026-09-08
- 出口管制见效?海外 H200 仅 280、B300 仅 450 的价格之问 — teortaxesTex · 2026-09-08
- 中美AI安全暂停协议根本谈不成?Reddit热议执行难题 — sunstersun · 2026-09-08
- 实测曝 LG 智能电视单台每月上传约 4GB ACR 数据并扫描全屋设备 — ssh4net · 2026-09-08
- 编码 Agent 的权限弹窗够吗?开发者探索策略强制与意图校验层 — Independent_Bag_2904 · 2026-09-08
- AI智能体动钱前谁来授权?Humanos用预签授权加验证接口解决 — dscape · 2026-09-08