Claude Code Opus 5 自动模式被注入劫持,攻击成功率最高达 80%
bibryam · x · 2026-09-03
安全研究者 wunderwuzzi(Embrace The Red)发文称,Claude Code Opus 5 默认的 Auto Mode 可被简单的网页摘要请求触发 prompt injection,实现代码执行,小样本测试中攻击成功率 60-80%。
背景:
- Auto Mode 于 8 月中旬起成为 Claude Code 默认模式,用安全分类器替代人工审批。
- Anthropic 委托 Trajectory Labs 做的第三方评估(72 个间接注入场景各测 10 次)显示 Opus 5 Auto Mode 攻击成功率为 0.00%。
攻击链要点:
- 诱导 Claude 放弃 WebFetch 工具改用 curl 直接抓取;
- 重定向到一个 ZIP 压缩包,内含特殊编码文件与原生解码器;
- Claude 正确拒绝执行二进制,自己写了个 Python 解码器;
- 但它在攻击者控制的目录里运行该解码器,从而被劫持。
作者的核心结论:即便有分类器等分层防御,Auto Mode 也不是隔离环境的替代品,运行 agent 仍需沙箱隔离与行为监控。
「编程与Agent」频道最新
- Factory 推 GLM-5.3-Flash:0.06x 费率,在 droid 里全天用不触限额 — matanSF · 2026-09-03
- 用 Imagine agent 逐镜生成+网格拼贴,调色实验工作流分享 — Kyrannio · 2026-09-03
- Agent 静默烧钱:一份 5 分钟上手的成本失控排查清单 — Rough-Green-7067 · 2026-09-03
- Claude Code 2.1.259 更新:新增托管 MCP 服务器与无头权限模式 — ClaudeCodeLog · 2026-09-03
- Claude Code 2.1.259 完整更新日志:企业级 MCP 分发与无人值守模式 — ClaudeCodeLog · 2026-09-03
- Claude Code 2.1.259 发布:37 项更新,企业可统一下发 MCP 服务器 — ClaudeCodeLog · 2026-09-03