本地Prompt注入防护:文本图文音频都能查
BordairAPI · reddit · 2026-07-20
Bordair Detector 是一个开源、可本地运行的 prompt injection / jailbreak 防护器,面向所有把用户输入送进 LLM 的应用。
- 采用 两阶段检测:先用规则/正则在 1ms 级别拦截明显攻击,只有模糊样本才送入量化后的 DeBERTa-v3 ONNX 分类器。
- 支持 多模态输入:不仅查文本,还能扫描 OCR 图片、EXIF/元数据、隐写内容、PDF/DOCX 和音频转写。
- 还能做 多轮检测,识别被拆分到多条消息里的攻击载荷。
- 全部本地运行,权重来自 Hugging Face,没有 API 依赖。
- 项目还附带数据集与模型权重,训练数据超过 50 万样本,并包含从实战红队游戏里收集的 13,230 条攻击样本。
这是一个很典型的 AI 安全/对齐基础设施工具。
「安全」频道最新
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11
- 实测 Spotify 聊天机器人:挡住2023老越狱,却肯帮写代码 — AaronBergman18 · 2026-09-11
- 作者拆解一张 99% 真实的 AI 改图:检测器几乎无法识别 — henkvaness · 2026-09-11