本地Prompt注入防护:文本图文音频都能查

BordairAPI · reddit · 2026-07-20

Bordair Detector 是一个开源、可本地运行的 **prompt injection / jailbreak 防护器**,面向所有把用户输入送进 LLM 的应用。 - 采用 **两阶段检测**:先用规则/正则在 1ms 级别拦截明显攻击,只有模糊样本才送入量化后的 DeBERTa-v3 ONNX 分类器。 - 支持 **多模态输入**:不仅查文本,还能扫描 OCR 图片、EXIF/元数据、隐写内容、PDF/DOCX 和音频转写。 - 还能做 **多轮检测**,识别被拆分到多条消息里的攻击载荷。 - 全部本地运行,权重来自 Hugging Face,没有 API 依赖。 - 项目还附带数据集与模型权重,训练数据超过 50 万样本,并包含从实战红队游戏里收集的 **13,230** 条攻击样本。 这是一个很典型的 AI 安全/对齐基础设施工具。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →