语义防火墙拦截恶意 MCP 工具调用
ChannelLivid · reddit · 2026-08-30
作者发布了一个 MCP stdio 代理,旨在通过语义意图而非正则匹配来阻断危险工具调用。
背景与痛点
随着 MCP (Model Context Protocol) 采用率提升,Agent 被劫持或产生幻觉后盲目执行危险指令(如删库、泄露 .env 文件)的风险增加。单纯依赖模型内部对齐不可靠,需要在外部传输层增加安全边界。
核心功能
- 拦截机制:代理位于 stdio MCP 服务器之前,拦截 tools/call JSON-RPC 消息。
- 语义判断:使用 Ramen AI 评估 {tool, arguments} 的潜在意图,若判定为恶意则合成 isError 响应,阻止指令发送给下游服务;否则转发。
- 优势:相比正则表达式(只能检测 DELETE FROM... 等显式语法),语义边界能识别“执行标准数据库清理程序”等隐含危险操作的指令。
限制
- 需使用 RAMENAPIKEY(免费版每月 1000 次评估,需自备密钥)。
- 引入约 900ms 延迟(云端评估)。
- 仅拦截 tools/call,其他消息(如 prompts/get)直接透传。
「编程与Agent」频道最新
- VibeKit MCP 服务器:支持部署监控与无头编码 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- 大数据集 MCP 服务器如何避免上下文窗口瓶颈 — JuicerSocial · 2026-09-01
- 把LLM引用当监控数据:用Grok Bot做AI搜索排名 — rohanpaul_ai · 2026-09-01
- 搜索配置比模型选型更能影响 Agent 准确率 — RichardSocher · 2026-09-01
- 用 Claude 构建英雄联盟怀旧版 Wiki 与出装模拟器 — Shortykane · 2026-09-01