Cyber Index 榜单:Grok 4.7 与 MiMo-V2.6-Pro 并列第一,安全拒答拖垮前沿模型

ArtificialAnlys · x · 2026-09-28

Artificial Analysis 发布 Cyber Index 及 Cyber Index Alliance,联合 Collinear AI、IBM、NVIDIA、Vercel 等伙伴,为企业网络防御场景建立模型评测新标准。指数合并三个基准:

成绩:Grok 4.7(xhigh)与 MiMo-V2.6-Pro 以 56 分并列第一,GPT-6 Luna(max)53 分、GLM-5.3-Flash 50 分、Muse Spark 1.3(xhigh)44 分。

安全拒答是关键变量:GPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1、Gemini 3.8 Flash 拒绝了占指数 32-38% 权重的任务,导致落后榜首 19-31 分;其中在 CyberGym-E2E-AA 上 GPT-6 Sol/Astra 拒答率 100%,Claude Opus 5.5 达 98%。

所属事件:Artificial Analysis 发布 Cyber Index:Grok 4.7 与 MiMo 并列榜首(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →