Wiz发布Cyber Model Arena:Gemini 3.8 Flash Cyber以74.9%居首
rseroter · x · 2026-09-11
Wiz 团队发布 Cyber Model Arena,用基础模型搭配标准 harness 在多个真实网络安全任务上评测 AI 智能体,覆盖代码、漏洞、API 安全、Web 安全、CTF、云安全等类别,并给出成功率对成本、时间、步数的权衡。
榜单要点(pass@1 总分):
- Gemini 3.8 Flash Cyber + ADK React 以 74.9% 居首,成本约 $1.62/次、5 分钟/次;
- Claude Opus 5 + Claude Code 71.2% 第二;
- Gemini 3.8 Flash Cyber + Claude Code 68.5% 第三;
- GPT-5.6 Sol + ADK React 66.9% 第四;
- Claude Opus 4.8 + Claude Code 65.4% 第五;
- 国产模型中 GLM-5.3 + Claude Code 58%、DeepSeek V4 Pro + Claude Code 54.4%(成本仅 $0.67/次,性价比突出)。
评测同时对比了 ADK React 与 Claude Code 两种 harness 对同一模型成绩的影响。
所属事件:Wiz发布Cyber Arena实测各模型黑客能力(2 条相关)→
「模型」频道最新
- 传 Qwen 3.8-Flash-Next 与 V4-Flash 同级,参数小 4 倍引热议 — teortaxesTex · 2026-09-11
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 曝 Fable 5.1 登顶 InferenceBench,推理提速达 9.83 倍 — maksym_andr · 2026-09-11
- 问交规问题也被拦:Astra 护栏误报率遭用户吐槽 — Angaisb_ · 2026-09-11
- 数据科学家转 AI 工程常跳过的课:LLM 看到的是 token 不是文字 — mdancho84 · 2026-09-11
- 开发者实测 OpenAI 新语音模型,语音操控咖啡冲煮全程 — paw_lean · 2026-09-11