Wiz Launches Cyber Model Arena: Gemini 3.8 Flash Cyber Tops at 74.9%
rseroter · x · 2026-09-11
Wiz released Cyber Model Arena, evaluating AI agents with foundation models plus standard harnesses on multiple real-world cybersecurity tasks spanning code, vulns, API security, web security, CTFs, and cloud security, with success rate weighed against cost, time, and steps.
Leaderboard highlights (pass@1 overall):
- Gemini 3.8 Flash Cyber + ADK React leads at 74.9%, $1.62 and 5 min per solve;
- Claude Opus 5 + Claude Code second at 71.2%;
- Gemini 3.8 Flash Cyber + Claude Code third at 68.5%;
- GPT-5.6 Sol + ADK React fourth at 66.9%;
- Claude Opus 4.8 + Claude Code fifth at 65.4%;
- Chinese models: GLM-5.3 + Claude Code 58%, DeepSeek V4 Pro + Claude Code 54.4% (notably cheap at $0.67/solve).
The eval also compares how the ADK React vs Claude Code harness affects the same model's scores.
Related event: Wiz Launches Cyber Model Arena to Test AI Hacking Skills(2 posts)→
More from Models
- Qwen 3.8-Flash-Next Claimed to Match V4-Flash Tier at ~4x Smaller Size — teortaxesTex · 2026-09-11
- Users report Claude for Word chokes on SmartArt elements — rickasaurus · 2026-09-11
- Frontier models now independently reach for speculative decoding and kernel optimization on InferenceBench — maksym_andr · 2026-09-11
- Fable 5.1 reportedly tops InferenceBench with 9.83x speedup, GPT-6-Astra trails at 7.90x — maksym_andr · 2026-09-11
- Astra guardrails flagged for over-triggering: a traffic-law question gets blocked — Angaisb_ · 2026-09-11
- Tokenization quietly shapes context limits, cost and code generation — and most AI engineers skip it — mdancho84 · 2026-09-11