Kimi K3 软件任务评测紧咬 Fable 5,开源追平闭源

最新基准对比数据显示,开源模型 Kimi K3 在软件工程任务中的表现已与 Fable 5 高度接近,两者在逐任务表现上的相关系数高达 0.72,创下不同厂商模型间的最高相似度记录。这表明前沿开源模型已经不再落后于闭源模型半年,行业格局正在发生实质性改变。

关键细节与性能对比

在核心的 pass 指标上,Kimi K3 与 Fable 5 在 pass@1 上仅差 1 分,但在更大采样预算下 Kimi K3 开始显现优势,其 pass@2 达到 82.0%,pass@4 达到 89.4%,超过了 GPT-5.6 Sol。在编程语言方面,Fable 5 包揽了 Python、JavaScript、TypeScript 和 Rust 的领先地位,而 Kimi K3 仅在 Go 语言上实现反超(79 分对 71 分)。此外,两者的失败模式几乎一致,均有约 65% 的失败属于“差一点就成功”,且能较好保住现有基线,回归率分别为 11% 和 10%。由于没有任何任务出现一方总是通过、另一方总是失败的极端分化,分析指出该基准测试可能已接近饱和。

算力经济与成本优势

在展现出同等性能的同时,Kimi K3 具备显著的算力经济优势。数据显示,Kimi K3 单次运行成本仅为 4.65 美元,而 Fable 5 高达 13.41 美元。按照每 100 美元投入计算,Kimi K3 能够解决 14.7 个任务,相当于 Fable 5 处理量的 2.8 倍。

2026-07-21 ~ 2026-07-21 · 6 条相关

事件全程(共 20 集)→