Merge Gateway 推出提示词注入防护:用微调分类器拦截攻击
shensi · x · 2026-08-11
针对 LLM 应用的提示词注入攻击,Merge Gateway 推出了专门的防护方案。作者指出,目前市面上很多路由网关所谓的“护栏”仅靠简单的正则表达式黑名单,只能拦截用户直接输入的敏感词,对隐藏在工具返回结果或模型响应中的攻击指令无能为力。
Merge Gateway 的技术方案:
- 使用微调过的 DeBERTa v3 分类器,作为数据平面的 sidecar 部署,对每次请求的输入和输出进行打分(0.0 到 1.0)。
- 设有双重阈值:分数 ≥ 0.57 触发拦截/重定向等强制动作;分数 ≤ 0.30 视为正常;中间区间仅记录不拦截。
- 默认参数经过多数据集校准,目标是将误报率控制在 1%。
- 提供三种工作模式:关闭、仅告警 和 拦截,建议用户先在告警模式下观察并调整白名单,再开启强制拦截。
「编程与Agent」频道最新
- 开源项目 Oil Motion:让 AI 智能体一键生成交互动画 — victor_explore · 2026-08-11
- 开发者分享:用 Grok 构建递归 QA 循环优化文本分类 — kylegawley · 2026-08-11
- 网友让ChatGPT用Python生成视频,表达“身为LLM的感受” — Tango_Foxtrot404 · 2026-08-11
- Hermes Pixel Office 上线:VSCode 实时可视化你的 AI 智能体 — max_paperclips · 2026-08-11
- 别把日志当记忆:真正的 AI Agent 需要可信的持久化状态 — mattturck · 2026-08-11
- 两行提示词开发舆情监听工具,月成本仅10美元 — ayushtweetshere · 2026-08-11