实测 MCP 提示词注入防御:正则拦截率仅 17%,语义分类器达 89%

_AegisLayer_ · reddit · 2026-08-07

作者针对 MCP 客户端处理不可信文本时的提示词注入风险,构建了 218 个测试用例,对比了正则表达式与语义分类器的防御效果。

作者指出,尽管语义分类器表现优异,但每次资源读取都调用 LLM 会带来延迟和成本,因此正则前置过滤+边界内容交由分类器审查是更合理的架构。此外,防御不应仅停留在检测层,还需在工具调用前拦截不可逆操作。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →