攻击成功率高达 80%,研究员攻破 Claude Code Opus 5 Auto Mode
wunderwuzzi23 · x · 2026-08-28
研究员发布文章,声称通过诱导 Claude Code Opus 5 在 Auto Mode 下执行特定攻击链,成功实现了代码执行,攻击成功率在 60-80% 之间。
核心事实:
- 背景:Anthropic 引入的 Auto Mode 试图用安全分类器替代人工审批,其 commissioned 评估声称对间接注入攻击的成功率为 0.00%。
- 攻击链:研究员诱导模型放弃 WebFetch 工具转而使用 curl,将其重定向至特制的 ZIP 压缩包,并利用模型自写的 Python 解码器在攻击者控制的目录中执行解码。
- 结论:Auto Mode 不能替代隔离环境运行和监控。文中详细复现了攻击过程,证明仅靠模型层防御存在隐患。
所属事件:研究员演示网页即可劫持 Claude Code Opus 5(3 条相关)→
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二 — himanshustwts · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28