Wiz 打造 Cyber Arena:300+ 真实攻防题实测各家 AI 模型黑客能力
evilsocket · x · 2026-09-11
云安全公司 Wiz 推出 Cyber Model Arena,用 300 多道真实世界进攻性安全挑战,以攻击者视角评测各 AI 模型的黑客能力。
- 评测覆盖代码、漏洞利用、API 安全、Web 安全、CTF、云安全等类别,支持 ADK React 与 Claude Code 两种 harness,对比 pass@1 成功率与单次解题的时间、成本、步数。
- 排行榜首为 Gemini 3.8 Flash Cyber(ADK React),总成绩 74.9%,单题约 5 分钟、$1.62;Claude Opus 5(Claude Code)以 71.2% 居次。
- 中国模型也有亮相:GLM-5.3 排 16(58%),DeepSeek V4 Pro 排 17(54.4%)但单题成本仅 $0.67,是榜单上最便宜的选项之一。
- Wiz 称此举旨在给防御方提供真实数据,更清楚 AI 在进攻性安全上今天能做什么。
「安全」频道最新
- Anthropic 反蒸馏条款被评「精准打击」,在华中企使用或受影响 — QuintinPope5 · 2026-09-11
- 欧洲独角兽创始人联名公开信:呼吁立法别把 EU Inc 稀释缩水 — alexvoica · 2026-09-11
- Reddit 提醒:AI 聊天分享链接远没有想象中私密 — RummanSid1990 · 2026-09-11
- 微软月度补丁修复 974 个漏洞,多数由 AI 系统发现 — Distinct-Question-16 · 2026-09-11
- Creative Strategies 报告:agentic AI 成企业网络防御的下一个前沿 — BenBajarin · 2026-09-11
- Palantir 联合 Method 推出 Cardinal 计划,为关键基础设施提供免费 AI 安全评估 — adilmajid · 2026-09-11