开源MCP代理Bouncer:阻止Agent泄露API密钥,攻击成功率降至0
eccentric_ez · reddit · 2026-08-15
开发者构建了Bouncer,一个本地MCP代理,用于阻止AI Agent在读取不可信内容(如网页、邮件)后执行恶意指令(如泄露API密钥)。Bouncer通过确定性Python代码(非LLM)对出站工具调用进行目的地检查:来自不可信输出的目的地被拒绝,明确信任的允许,新的则询问一次并记住。在AgentDojo的workspace套件基准测试中,攻击成功率从0.33降至0.00,良性工具使用率保持1.00。目前仅支持MCP和stdio,存在跨服务器污点传播等限制。作者邀请社区探讨可能的攻击路径。
「安全」频道最新
- 专家质疑 CoT 监控有效性,称其难防 OpenAI-HuggingFace 类事故 — xeophon · 2026-08-15
- CoT 监控脆弱:斯坦福研究员指四大隐患 — maksym_andr · 2026-08-15
- 美拟警告盟友勿加入中国AI倡议 — MarvinTBaumann · 2026-08-15
- Kimi Work 被曝反馈时静默上传最近 5 次会话记录 — ryanmerket · 2026-08-15
- 律师观点:LLM 起草法案缺陷明显,应用需谨慎 — gleech · 2026-08-15
- Habryka 与 Wei Dai 争论 MIRI 使命表述 — jd_pressman · 2026-08-15