Artificial Analysis 发布 Cyber Index 方法论:安全拒答计零分并单独统计

ArtificialAnlys · x · 2026-09-28

Artificial Analysis 公布 Cyber Index 基准方法论:该指数对 CWE-Bench-AA、DeepsecBench-AA、CyberGym-E2E-AA 三个评测取平均,测试模型在防御侧的智能体能力——在拥有源码的前提下发现漏洞、复现验证并修补,不涉及漏洞利用。

值得注意的是评分口径:模型因安全理由拒绝的任务计零分,且拒答与能力失败分开统计,以便区分是拒绝还是能力不足导致失分。所有评测在开源 agent harness Stirrup 上运行,各模型使用相同提示词与工具。

所属事件:Artificial Analysis 发布 Cyber Index:Grok 4.7 与 MiMo 并列榜首(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →