实测 MCP 提示词注入防御:正则拦截率仅 17%,语义分类器达 89%
_AegisLayer_ · reddit · 2026-08-07
作者针对 MCP 客户端处理不可信文本时的提示词注入风险,构建了 218 个测试用例,对比了正则表达式与语义分类器的防御效果。
- 正则基线:使用 51 个模式,攻击召回率仅 16.9%,且在处理探讨安全漏洞的普通文本时误报率飙升。
- 语义分类器:使用 claude-haiku-4-5,攻击召回率达 89.0%,精准率 98.1%。
- 对抗测试:在 29 个手工构造的混淆用例(如编码、间接注入、外文、隐藏文本)中,正则基线拦截率为零,语义分类器则全部捕获。
作者指出,尽管语义分类器表现优异,但每次资源读取都调用 LLM 会带来延迟和成本,因此正则前置过滤+边界内容交由分类器审查是更合理的架构。此外,防御不应仅停留在检测层,还需在工具调用前拦截不可逆操作。
「编程与Agent」频道最新
- 开发者发布 Codex 技能:用随机强制联想激发 AI 创意 — iandanforth · 2026-08-07
- 开发者分享“强制联想”法:用随机关联打破 AI 思维定式 — iandanforth · 2026-08-07
- 构建优秀 Agent 框架的秘诀:别用最强模型 — sull · 2026-08-07
- 高质量连接器让 Agent 步骤减半:实测对比 MCP 公共服务器 — shensi · 2026-08-07
- GitHub 2.7万星系统设计与 AI 工程开源教程 — Roger_M_Taylor · 2026-08-07
- Perplexity 开源 Numbat:监控并拦截 AI Agent 危险操作 — gvyshnya · 2026-08-07