CMU 推出 ExploitBench:实测 AI 智能体 V8 引擎漏洞利用能力
cyb3rops · x · 2026-08-11
卡内基梅隆大学(CMU)团队推出 ExploitBench,一个专门测试 AI 智能体实际漏洞利用能力的新基准。与现有测试不同,它不仅检查单点结果,而是评估从定位漏洞、触发 Bug、构建 exploit 到实现任意代码执行的完整链条。
首发的 v8-bench 针对生产环境中的 V8 引擎(广泛用于 Chrome、Node.js 等),并在开启 V8 安全沙箱的严格条件下进行测试。
在针对极难 WASM 漏洞(CVE-2024-6100)的实测中,经过特定改造的 CyberKimi 结合方法学包达到了 10/16 的成绩,超越了所有公开权重模型及多数私有模型。目前榜单前列主要是带有 AutoNudge(自动提醒机制)的 Anthropic 与 OpenAI 顶级模型,其中 Claude Mythos Preview 以 78% 的覆盖率位居第一。
「编程与Agent」频道最新
- Pydantic AI Harness v0.18.1 发布 — solyarisoftware · 2026-08-11
- 构建AI智能体:外部系统是最好的记忆 — goyalshaliniuk · 2026-08-11
- 不查代码不知道:前沿 AI 编程仍留下大量垃圾代码 — HankYeomans · 2026-08-11
- 华为提出 VDGR-RAG:融合向量与图谱的企业级智能问答 — _reachsumit · 2026-08-11
- MIT推Carnot引擎:让深度研究查询可视、可纠偏 — _reachsumit · 2026-08-11
- 优化深度研究智能体:轻量启发式算法可削减 73% Token — _reachsumit · 2026-08-11