Cyber Index 方法论详解:三套基准合成,Grok 4.7 与 MiMo-V2.6-Pro 公开版并列 56 分
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 公布 Cyber Index 完整方法论与榜单:
- 指标衡量模型在网络防御上的能力:发现代码库漏洞、复现验证、打补丁且不破坏现有功能。
- 由三套评测合成:CWE-Bench-AA(基于 Collinear AI 的 CWE-bench)、DeepsecBench-AA(Vercel 的 DeepsecBench)、CyberGym-E2E-AA(Berkeley RDI 的 CyberGym-E2E),全部由 Artificial Analysis 独立执行。
- 公开模型榜:Grok 4.7 (xhigh) 以 56 分最高,MiMo-V2.6-Pro 同为 56,GPT-6 Luna (Max) 53 分;加上信任访问模型后 GPT-6 Sol (Daybreak Blue, max) 登顶。
所属事件:GPT-6 Sol 信任访问版登顶 Cyber Index,成本仅 Grok 的约六分之一(4 条相关)→
「模型」频道最新
- 6 个模型 MCP 工具实测:Opus 5.5 领先,开源模型成本仅 13% — shensi · 2026-10-09
- Gemini 视频「变慢」真相:Safari 不自动刷新,需手动刷新页面 — dreamwieber · 2026-10-09
- 同一模型差价数倍:Batch 半价、缓存低至一折的账怎么算 — AccBalanced · 2026-10-09
- 个人开发者单卡 4090 从零预训练 565M 混合架构模型并开源 — BLUECOW009 · 2026-10-09
- Anthropic 模型已有情绪、还会挂你电话,l4rz 吐槽「善待模型」新规 — l4rz · 2026-10-09
- NVIDIA 开源 NV-Reason-CT:原生 3D 视觉语言模型读 CT 影像 — NVIDIA Developer · 2026-10-09