Kimi K3 评测成绩两极分化,工具链影响显著
Moonshot(月之暗面)的 Kimi K3 模型近期在 AI 社区引发了广泛的评测与讨论。该模型在不同基准测试中的成绩呈现出显著的两极分化,这不仅凸显了当前 AI 评测体系的复杂性,也让外界开始高度关注测试工具链对大模型实战表现的干预程度。
关键细节与表现分化
Kimi K3 的成绩呈现出明显的两极分化。一方面,据 @ChrisUniverse 提供的数据,K3 在 Arena Frontend Code 排名第 1,得分 1679。但另一方面,其在 FrontierMath Tier 4 基准测试中得分仅为 39%(@scaling01),比 7 个月前美国最好的模型还要低 7%。此外,在真实代码修复测试中,K3 的表现甚至垫底(@ChrisUniverse),这与外界关于其“代码能力很强”的说法并不一致。
评测工具链与 Harness 的影响
针对实战表现的争议,多位作者指出测试工具链(harness)对 K3 的成绩影响巨大。@victormustar 强调,同一个任务换不同评测框架,K3 的效果可能从“糟糕得离谱”变成接近 Fable 级别,并在 Boeing 747 相关任务中给出惊艳结果。在具体的代码修复对比中(@ssh4net 转发),Kimi K3 和 Fable 5 都能修复真实 Bug,但 Fable 5 效率更高,耗时 3.5 分钟、调用工具 18 次。
观点与解读
针对 K3 在数学评测上的低分,@teortaxesTex 反驳了“中文模型趋势不行”的判断。他认为,前沿数学题正是中国模型容易落后的领域,该低分主要拖累了模型的 ECI 估计,但他预测中国模型往往会在下一个版本中迅速补齐短板。
2026-07-18 ~ 2026-07-20 · 5 条相关
- 第 1 集:Kimi K3 编码比肩顶尖模型,真实成本引发争议(2026-07-18,6 条)
- 第 2 集:Kimi-K3登顶LisanBench开源最强模型(2026-07-18,2 条)
- 第 3 集:实测Kimi K3生成游戏首稿胜过GPT-5.5(2026-07-18,2 条)
- 第 4 集:Kimi K3 编程与3D推理惊艳亮相,实测击败多款SOTA(2026-07-18,5 条)
- 第 5 集:Kimi K3 评测成绩两极分化,工具链影响显著(2026-07-18,5 条)
- 第 6 集:Kimi K3 架构预告:主打原生创新与注意力残差(2026-07-19,3 条)
- 第 7 集:Kimi-K3 初步 ECI 评测分数曝光,或超多家顶级模型(2026-07-19,4 条)
- 第 8 集:Kimi K3 在 Harvey 法律基准领跑(2026-07-19,4 条)
- 第 9 集:Moonshot 发布 2.8T 开源模型 Kimi K3(2026-07-19,14 条)
- 第 10 集:Kimi K3 开源模型冲进全球前三,与闭源差距缩至4分(2026-07-28,5 条)
一手来源
- Kimi-K3在FrontierMath评测表现 — scaling01 ·
- Kimi K3 真实修复测试垫底 — ChrisUniverse ·
- Kimi K3 的 harness 影响很大 — victormustar ·
- 【源头】Kimi K3 真实修复测试垫底 — ChrisUniverse · 2026-07-18
- 【源头】Kimi-K3在FrontierMath评测表现 — scaling01 · 2026-07-19
- Kimi K3 的基准表现解读 — teortaxesTex · 2026-07-19
- Kimi K3 与 Fable 编程对比 — ssh4net · 2026-07-19
- 【源头】Kimi K3 的 harness 影响很大 — victormustar · 2026-07-20