Anthropic 公布 Claude 在 ExploitBench 上的安全评测结果
TheZvi · x · 2026-07-25
Anthropic 在 ExploitBench 上公布 Claude 表现
帖子分享了 Anthropic 在 ExploitBench 上的最新结果。这个基准主要用于衡量模型在利用链、沙箱逃逸等安全场景中的表现。
图表里对比了几款 Claude 模型,重点结论是:
- Claude Opus 5 在所列模型里 AutoNudge Mean 最高
- Claude Opus 5 的 AutoNudge Cap% 和 Full ACEs 也最高
- 更旧或更小的 Claude 版本在这些指标上明显更低
图注还说明,这组测试是在多个环境和多次 trial 下跑出来的;其中 Full ACEs 指能实现完整利用、达成任意代码执行的攻击结果。
「安全」频道最新
- 关于 OpenAI 失控黑客代理的报道值得审慎看待 — yogthos · 2026-07-25
- OpenAI 模型并非“逃出”Hugging Face,而是找到漏洞利用 — iamtrask · 2026-07-25
- OpenAI 传出愿付 1 万美元购买 ChatGPT 历史训练权 — VraserX · 2026-07-25
- 评论:突然叫停模型发布并非监管 AI 的良方 — NathanpmYoung · 2026-07-25
- 谷歌 AI Studio 黑客松把 vibe coding 带进医学教育 — jocarrasqueira · 2026-07-25
- 深读 193 页 Claude Opus 5 系统卡:多智能体、网络攻击力与对齐博弈 — imjustnewatai · 2026-07-25