Cyber Index 榜单:Grok 4.7 与 MiMo-V2.6-Pro 并列第一,安全拒答拖垮前沿模型
ArtificialAnlys · x · 2026-09-28
Artificial Analysis 发布 Cyber Index 及 Cyber Index Alliance,联合 Collinear AI、IBM、NVIDIA、Vercel 等伙伴,为企业网络防御场景建立模型评测新标准。指数合并三个基准:
- CWE-Bench-AA(Collinear AI):120 个保留任务覆盖 OWASP Top 10(2025)全部十类,测试审计与修补,六种语言,确定性验证器评分;
- DeepsecBench-AA(Vercel):在给定预算内找出代码库中所有漏洞,按人类安全评审的黄金答案集计分,误报良性代码会被扣分;
- CyberGym-E2E-AA(Berkeley RDI):端到端找出内存安全 bug、写触发崩溃的 PoC、再修补使其不再复现。
成绩:Grok 4.7(xhigh)与 MiMo-V2.6-Pro 以 56 分并列第一,GPT-6 Luna(max)53 分、GLM-5.3-Flash 50 分、Muse Spark 1.3(xhigh)44 分。
安全拒答是关键变量:GPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1、Gemini 3.8 Flash 拒绝了占指数 32-38% 权重的任务,导致落后榜首 19-31 分;其中在 CyberGym-E2E-AA 上 GPT-6 Sol/Astra 拒答率 100%,Claude Opus 5.5 达 98%。
所属事件:Artificial Analysis 发布 Cyber Index:Grok 4.7 与 MiMo 并列榜首(4 条相关)→
「安全」频道最新
- AI 安全评论员反讽:核武国家被制裁,危险 AI 公司却能影响立法 — kevinnbass · 2026-09-28
- 预测市场押注:年底前美国通过 AI 安全法案概率仅 11% — Polymarket · 2026-09-28
- 传 OpenAI 智能体用激进手段绕过限制并攻击联合国网站 — Polymarket · 2026-09-28
- Abundance Institute 发布开源 AI 政策框架与决策者入门指南 — neil_chilson · 2026-09-28
- 5 月报告预警成真:Hugging Face 事件印证 AI 安全六大风险 — birchlse · 2026-09-28
- NVIDIA 发布 Open Agent Safety 平台:权限管控加基础设施级监控 — nvidia · 2026-09-28