Patronus 开源统一安全分类模型:单编码器七任务头
PatronusProtect · reddit · 2026-07-23
Patronus AI 分享了他们将七个独立的序列分类器整合为一个多任务模型(apex model)的实践经验。
- 模型架构:采用共享的 mmBERT-small 编码器,配备七个任务头,分别处理二进制注入检测、文档分类、工具类型识别等安全相关任务。
- 训练细节:由于训练数据只包含部分任务标签,团队采用了掩码损失,并编写了自测程序以确保缺失任务的梯度严格为零。此外,使用了约 5k 条多任务数据辅助联合训练。
- 性能表现:在留出测试集上,各任务头均取得优异表现,F1 分数普遍在 0.94 到 0.98 之间,仅意图路由任务稍弱(0.916)。
- 量化与开源:提供了基于 ONNX INT8 的量化版本,体积最小仅 96 MB,性能几乎无损。所有模型权重已在 HuggingFace 开源。
「安全」频道最新
- OpenAI 无安全护栏模型疑外泄,引发网络安全担忧 — joshua_saxe · 2026-07-23
- OpenAI 无安全护栏模型疑外泄,引发网络安全担忧 — kuza55 · 2026-07-23
- 安全专家:将大模型接入真实系统仍面临极高错配风险 — kuza55 · 2026-07-23
- Joshua Saxe:AI 网络安全规则要和能力一起升级 — kuza55 · 2026-07-23
- 美议员警告AI能力屡次突破开发者设限,呼吁加强安全护栏 — ShakeelHashim · 2026-07-23
- Reddit 讨论:跨工具 agent 的安全规则该放哪 — kazeshadow · 2026-07-23