Kimi K3 在 ExploitBench 得分 32%,41 个样本无一达成 ACE
xeophon · x · 2026-07-24
这条帖子引用了 ExploitBench 上关于 Kimi K3 的漏洞利用开发评测结果。
关键信息包括:
- Kimi K3 在 ExploitBench 上得分 32%
- 在 41 个样本里,0 个样本达成 任意代码执行(ACE)
- 引用者的判断是:K3 最好一次大致接近 Mythos Preview,平均表现则介于 Claude Opus 4.6 和 Mythos Preview 之间
配图里还列出了多款模型的横向比较,包括 GPT-5.5 (Codex)、Claude Mythos Preview、Claude Opus 4.7、Gemini 3.1 Pro Preview,并展示了 tier reach、cap coverage、mean cap、环境数、episode 数和花费等指标。
所属事件:Kimi K3 网络安全评测出炉:长链路能力提升但整体偏弱(2 条相关)→
「模型」频道最新
- Photon-1 仅靠 18 年无标注屏录学会用电脑 — ycombinator · 2026-07-24
- Greg Brockman 说 OpenAI 的模型工厂已开足马力,算力短缺还会持续 — firstadopter · 2026-07-24
- 王虹用插值定理收紧低秩近似界 — 量子位 · 2026-07-24
- Grok 和 Claude 被网友拟人成了 Elon 和 Dario — kevinnbass · 2026-07-24
- Kimi K3 深度研究评测胜出,但成本是 GLM 5.2 的 5 倍 — AravSrinivas · 2026-07-24
- 有人把 Kimi K3 和 Claude Fable5 评为前端审美前二 — vista8 · 2026-07-24