本地Prompt注入防护:文本图文音频都能查
BordairAPI · reddit · 2026-07-20
Bordair Detector 是一个开源、可本地运行的 **prompt injection / jailbreak 防护器**,面向所有把用户输入送进 LLM 的应用。 - 采用 **两阶段检测**:先用规则/正则在 1ms 级别拦截明显攻击,只有模糊样本才送入量化后的 DeBERTa-v3 ONNX 分类器。 - 支持 **多模态输入**:不仅查文本,还能扫描 OCR 图片、EXIF/元数据、隐写内容、PDF/DOCX 和音频转写。 - 还能做 **多轮检测**,识别被拆分到多条消息里的攻击载荷。 - 全部本地运行,权重来自 Hugging Face,没有 API 依赖。 - 项目还附带数据集与模型权重,训练数据超过 50 万样本,并包含从实战红队游戏里收集的 **13,230** 条攻击样本。 这是一个很典型的 AI 安全/对齐基础设施工具。
「安全」频道最新
- 法官批准 Anthropic 15 亿美元版权和解,创美国纪录 — Polymarket · 2026-07-21
- RepoAI 给 MCP 服务器打可信分,专看权限和危险工具 — Low_Location1261 · 2026-07-21
- Sriram Krishnan:开权重模型更容易做安全防护,因为人人都能审查 — pstAsiatech · 2026-07-21
- Anthropic 15 亿美元版权和解获最终批准 — TechCrunch AI · 2026-07-21
- 柏林 workshop 把密码学、安全和 AI safety 拉到一起 — allisondman · 2026-07-21
- AI 系统把数据治理推进到实时数据流 — ProfChesterman · 2026-07-21