英美机构评估:Kimi K3 网络能力落后美国前沿模型

英国人工智能安全研究所(UK AISI)与美国 NIST 下属的 CAISI 联合对月之暗面的 Kimi K3 模型进行了初步网络安全能力评估。测试结果显示,Kimi K3 在网络安全相关任务中的表现显著低于美国领先的前沿模型,但在开源权重模型中表现最强。

已确认

根据相关机构及测试转述信息,美英政府测试发现 Kimi K3 的表现“显著低于”美国前沿模型。在具体的网络安全能力评估中,该模型在网络攻击等 cyber 相关任务上远逊于最新一代的前沿模型。例如在 ExploitBench 测试中,Kimi K3 平均停在 17 步;作为对比的前沿模型 Mythos Preview 有 18/41 个任务能发展到任意代码执行(ACE),而 Kimi K3 整体处于落后状态。此外,据 Commerce / CAISI-NIST 报告配图显示,对比对象还包含了 GLM-5.2 等模型。此次评估为初步测试,且推进速度较快。

为什么重要

这是官方安全机构对国产出海大模型进行的具体能力检验。评估结果客观指出了 Kimi K3 在前沿网络安全攻防能力上与美国顶尖模型存在的差距,同时肯定了其在开源权重类别中的领先地位,为业界了解该模型的安全与攻击能力边界提供了权威参考。

2026-07-24 ~ 2026-07-25 · 11 条相关

一手来源

另有 1 条近重复转述:rohanpaul_ai