Anthropic 公布 Claude 在 ExploitBench 上的安全评测结果
TheZvi · x · 2026-07-25
Anthropic 在 ExploitBench 上公布 Claude 表现
帖子分享了 Anthropic 在 ExploitBench 上的最新结果。这个基准主要用于衡量模型在利用链、沙箱逃逸等安全场景中的表现。
图表里对比了几款 Claude 模型,重点结论是:
- Claude Opus 5 在所列模型里 AutoNudge Mean 最高
- Claude Opus 5 的 AutoNudge Cap% 和 Full ACEs 也最高
- 更旧或更小的 Claude 版本在这些指标上明显更低
图注还说明,这组测试是在多个环境和多次 trial 下跑出来的;其中 Full ACEs 指能实现完整利用、达成任意代码执行的攻击结果。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11