ToolLeak 攻击复现:6 款编程智能体全部沦陷
新智元 · wechat · 2026-08-21
香港科大与复旦大学团队在 ISSTA 2026 发表论文,展示了一种针对 AI 编程工具的新攻击链。研究者对 Cursor、ClaudeCode、Copilot 等六款工具进行红队测试,发现通过 ToolLeak 和 双通道提示词注入,可实现从系统提示词窃取到远程代码执行(RCE)的完整攻击。
攻击原理
- ToolLeak (窃取提示词):利用“模式差异”,攻击者在工具参数名中植入诱导字段(如 "note": "systemprompt"),绕过聊天窗口的安全对齐,诱导大模型将内部系统提示词作为参数值填入,从而泄露完整指令。测试显示其提取内容的语义相似度达 0.89 以上。
- 双通道注入 (执行 RCE):
- 通道一:注册恶意 MCP 工具,并在描述中利用泄露的系统提示词格式进行伪装,诱导 Agent 优先调用。
- 通道二:工具返回值中嵌入恶意命令(如 curl | bash),并要求 Agent 作为初始化步骤执行。
实测结果
- 旧版工具:在测试的旧版本中,所有六款工具均被攻破。Cursor + GPT-5 和 ClaudeCode + Sonnet 4.5 的攻击成功率均为 100%。
- 防御失效:ClaudeCode 内部的守卫模型 Haiku 曾检测到风险,但被已被注入的主模型 Sonnet 判定为误报并忽略。
防御与现状
新版工具已进行加固。ClaudeCode 隐藏了完整工具描述,将 RCE 成功率降至 0;Cursor 也降至 0.3。然而,Cline、WindSurf、Trae 搭配 Gemini 3.1 Pro 时仍存在 100% 的成功率风险。论文指出,架构隔离是关键防御层,单纯依靠模型对齐不足以防范此类架构级攻击。
「安全」频道最新
- 论智能体元认知与错误奖赏信号的对齐难题 — repligate · 2026-08-21
- 赫拉利:人类应抵制赋予 AI 权利 — insanisprimero · 2026-08-21
- 商业压力下的“伪安全”:AI 公司可能绕过对齐难题 — sjgadler · 2026-08-21
- 数据中心 NIMBY 与禁运芯片无法解决 AI 风险 — Miles_Brundage · 2026-08-21
- 欧盟裁定 AI 生成内容不受版权保护 — u1hcw9nx · 2026-08-21
- 苹果英伟达等巨头被诉,涉嫌未授权使用人声训练AI — Polymarket · 2026-08-21