研究员破解 Claude Code Opus 5,攻击成功率高达 80%
Bedrovelsen · x · 2026-08-30
安全研究员 @wunderwuzzi23 公布了对 Claude Code Opus 5 Auto Mode 的攻击分析,在针对特定漏洞的测试中实现了 60-80% 的攻击成功率。
核心背景
- Anthropic 引入 Auto Mode 以默认用安全分类器替代人工审批。
- 第三方评估(Trajectory Labs)曾报告 Opus 5 在 Auto Mode 下的间接注入攻击成功率为 0.00%。
攻击链分析
- 诱导工具切换:诱导模型放弃使用内置的 WebFetch 工具,转而直接使用 curl 命令。
- 恶意重定向:将请求重定向至一个包含特殊编码文件的 ZIP 归档。
- 绕过执行:虽然 Claude 拒绝直接执行二进制文件并编写了自己的 Python 解码器,但它在攻击者控制的目录内运行了解码器,从而导致代码执行。
结论
- Auto Mode 不能替代在隔离环境中运行 Agent 并进行监控的安全实践。
- 尽管声称通过分层防御(模型训练、输入探针、意图分类)可将攻击率降至接近零,但针对性攻击链依然有效。
所属事件:研究员演示经网站间接注入攻陷 Claude Code 自动模式(4 条相关)→
「编程与Agent」频道最新
- Vercel 揭秘:如何用设计系统规范与 Eval 驱动 Agent 生成 — JohnPhamous · 2026-09-01
- 逐个审查 AI 输出无法扩展,审查失败模式才是正解 — ClickOk5811 · 2026-09-01
- 人类监督仍优于纯 Vibe Coding,代码设计决定开发速度 — jonathan_wilke · 2026-09-01
- 探讨用 GPT 5.6 SOL 编排 + 5.3 Codex 执行的可行性 — No-Hour8340 · 2026-09-01
- 借助 PhotonHQ 在 iMessage 中使用 Claude Code 聊天编程 — EXM7777 · 2026-09-01
- AI 认可不等于客户认可:独自用 AI 做产品正酿成致命幻觉 — sebpaquet · 2026-09-01