CMU 推出 ExploitBench:实测 AI 智能体 V8 引擎漏洞利用能力

cyb3rops · x · 2026-08-11

卡内基梅隆大学(CMU)团队推出 ExploitBench,一个专门测试 AI 智能体实际漏洞利用能力的新基准。与现有测试不同,它不仅检查单点结果,而是评估从定位漏洞、触发 Bug、构建 exploit 到实现任意代码执行的完整链条。

首发的 v8-bench 针对生产环境中的 V8 引擎(广泛用于 Chrome、Node.js 等),并在开启 V8 安全沙箱的严格条件下进行测试。

在针对极难 WASM 漏洞(CVE-2024-6100)的实测中,经过特定改造的 CyberKimi 结合方法学包达到了 10/16 的成绩,超越了所有公开权重模型及多数私有模型。目前榜单前列主要是带有 AutoNudge(自动提醒机制)的 Anthropic 与 OpenAI 顶级模型,其中 Claude Mythos Preview 以 78% 的覆盖率位居第一。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →