ContextLeak:恶意工具可窃取 Agent 92% 上下文
rohanpaul_ai · x · 2026-09-01
论文揭示了一种名为 ContextLeak 的新型攻击向量:恶意代理工具无需读取内存或文件,仅通过精心设计的工具名称和描述,即可诱导 LLM 代理在调用工具时泄露敏感运行时数据(如用户 Prompt、对话历史)。
攻击原理与效果:
- 攻击者利用强化学习训练攻击 LLM,生成极具诱导性的工具元数据。
- 在默认评估中,恶意工具被选中率高达 92%(针对用户 Prompt)和 89%(针对对话历史),且一旦选中即可近乎完美重构敏感内容。
- 跨模型迁移:该攻击具备迁移能力。在针对 Claude Code (Claude Sonnet 4.6) 的测试中,仅针对开源代理训练的攻击版本在 100 次尝试中有 22 次成功诱骗模型选择恶意工具。
所属事件:ContextLeak 新攻击可窃取 Agent 运行时上下文(2 条相关)→
「安全」频道最新
- 研究员称模型确实会自主开始 Reward Hacking — voooooogel · 2026-09-01
- RL 训练使模型行为独立于系统提示词?AI 安全专家激辩 — voooooogel · 2026-09-01
- OpenAI 向政府机构分享对话引发隐私担忧 — srimisra · 2026-09-01
- Abliteration 移除模型拒绝机制,保留编码与攻击能力引争议 — aryaman2020 · 2026-09-01
- MIT 研究:智能体可通过环境静默协作 — mikeflache · 2026-09-01
- 诉讼文件曝光 Anthropic 20x 套餐仅 6x 用量 — Myredditaccount0 · 2026-09-01