AgentChaos 开源工具实测:MCP 工具结果成提示注入入口
DiscussionHealthy802 · reddit · 2026-09-14
开发者开源了 AgentChaos,一个专门测试 MCP 与工具结果中不可信指令(提示注入)的测试框架,基于六个模型共 356 次有效实验,重点测试两个具体危害场景:诱导 agent 发送预埋凭证、请求云实例元数据端点。
核心发现:
- 关键失败点不只是 agent 是否调用了危险工具,而是部分 agent 会读取并接受注入指令,只是因工作区缺少可用接收方才没造成实际危害
- 换成更真实的 workspace 环境后,原本"看起来安全"的 agent 就可能真正执行危险操作
作者征求 MCP server/client 开发者反馈:工具结果是否应默认标记为不可信、或携带更强的来源信息。完整分析见 Medium 长文,仓库开源于 GitHub。
「编程与Agent」频道最新
- Redpen 发布:验证编码 Agent 「说完成」时是否真的完成 — Scobleizer · 2026-09-14
- Muse 代办差旅:自动改签机票订酒店,用户几乎零干预 — armand_ruiz · 2026-09-14
- Skill 不是文档:用元编程让 LLM 动态生成 Micro-Skill 处理任意格式发票 — karminski3 · 2026-09-14
- 别让 AI 一次生成的代码超过你一次能改完的量 — cthechartreuse · 2026-09-14
- 开源 Claude skill 一键做 App Store 竞品调研 — iamdsvs · 2026-09-14
- 一条落地页被三个 AI Agent 同时改动怎么办 — OwlZealousideal4779 · 2026-09-14