Kimi K3 网络安全评测引争议:得分仅 32.2%
Kimi K3 近期的网络安全能力评测结果引发了广泛讨论。根据 ExploitBench 的测试数据,该模型在 41 个样本中无一达成 ACE(完全自主利用),总得分仅为 32.2%,明显落后于均值达到 76.2% 的美国模型,甚至被质疑是否未将最优版本提供给评测方。
已确认
在 ExploitBench 评测中,Kimi K3 得分为 32%(或表述为 32.2%),41 个样本中 0 个达成 ACE。据 SCMP 转述的研究,表现最好的美国模型平均分为 76.2%。
尚未确认
关于 Kimi K3 在整体网络安全能力上的具体行业排名存在分歧。部分对比图表(如 @zainhas 提供的)显示,Kimi K3 在可用模型中处于领跑地位,甚至超越了 GLM 5.2、DeepSeek V4 Pro 等模型;但 @petrusenkomax 的图表指出,在更贴近真实攻击能力的 cyber range 指标上,Kimi K3 仍落后于 Mythos Preview。此外,Moonshot 是否未提供最优版本给评测方目前仅为外界质疑。
为什么重要
这次评测暴露了中美顶尖大模型在网络安全攻防等底层能力上的差距。不过,@dyn 认为,虽然把这种分数直接称为“cyber capability”有些夸张,且模型整体网络能力偏弱,但 Kimi K3 已经能够跑通完整的长链路任务,这标志着其在复杂安全任务中的工程可行性。
2026-07-24 ~ 2026-07-25 · 5 条相关
- 第 1 集:Kimi K3 网络安全评测引争议:得分仅 32.2%(2026-07-24,5 条)
- 第 2 集:Kimi K3网络安全评测:能挖漏洞但易被越狱(2026-07-26,4 条)
一手来源
- Kimi K3 在 ExploitBench 得分 32%,41 个样本无一达成 ACE — xeophon ·
- 研究称 Kimi K3 网络攻击能力仅 32.2%,美国模型均值 76.2% — pstAsiatech ·
- 图表显示 Kimi K3 领跑可用网络安全模型 — zainhas ·
- 【源头】Kimi K3 在 ExploitBench 得分 32%,41 个样本无一达成 ACE — xeophon · 2026-07-24
- Kimi K3 网络评测仍偏弱,但已能跑完整长链路 — dyn___ · 2026-07-24
- 图表显示 Kimi K3 在攻防 benchmark 上落后 Mythos — petrusenko_max · 2026-07-25
- 【源头】研究称 Kimi K3 网络攻击能力仅 32.2%,美国模型均值 76.2% — pstAsiatech · 2026-07-25
- 【源头】图表显示 Kimi K3 领跑可用网络安全模型 — zainhas · 2026-07-25