Kimi K3 软件任务评测紧咬 Fable 5,开源追平闭源
最新基准对比数据显示,开源模型 Kimi K3 在软件工程任务中的表现已与 Fable 5 高度接近,两者在逐任务表现上的相关系数高达 0.72,创下不同厂商模型间的最高相似度记录。这表明前沿开源模型已经不再落后于闭源模型半年,行业格局正在发生实质性改变。
关键细节与性能对比
在核心的 pass 指标上,Kimi K3 与 Fable 5 在 pass@1 上仅差 1 分,但在更大采样预算下 Kimi K3 开始显现优势,其 pass@2 达到 82.0%,pass@4 达到 89.4%,超过了 GPT-5.6 Sol。在编程语言方面,Fable 5 包揽了 Python、JavaScript、TypeScript 和 Rust 的领先地位,而 Kimi K3 仅在 Go 语言上实现反超(79 分对 71 分)。此外,两者的失败模式几乎一致,均有约 65% 的失败属于“差一点就成功”,且能较好保住现有基线,回归率分别为 11% 和 10%。由于没有任何任务出现一方总是通过、另一方总是失败的极端分化,分析指出该基准测试可能已接近饱和。
算力经济与成本优势
在展现出同等性能的同时,Kimi K3 具备显著的算力经济优势。数据显示,Kimi K3 单次运行成本仅为 4.65 美元,而 Fable 5 高达 13.41 美元。按照每 100 美元投入计算,Kimi K3 能够解决 14.7 个任务,相当于 Fable 5 处理量的 2.8 倍。
2026-07-21 ~ 2026-07-21 · 6 条相关
- 第 1 集:传闻称Gemini 3.5能力接近GPT-5.5水平(2026-07-05,3 条)
- 第 2 集:传闻称七月将迎来前沿AI模型密集发布(2026-07-06,5 条)
- 第 3 集:多款重磅大模型版本近期密集发布(2026-07-08,3 条)
- 第 4 集:Gemini 3.5 Pro 多次传出延期与性能争议(2026-07-10,6 条)
- 第 5 集:AI基建牛市逻辑:开源模型或压缩前沿实验室利润(2026-07-13,3 条)
- 第 6 集:AI效率提升反将放大需求(2026-07-13,2 条)
- 第 7 集:传 Gemini 3.5 Pro 近期发布(2026-07-14,3 条)
- 第 8 集:Kimi K3 预热升温,KIVINE 现身 Arena(2026-07-14,43 条)
- 第 9 集:Gemini 3.5 Pro 再延期传闻升温(2026-07-15,7 条)
- 第 10 集:前沿 AI 模型发布潮即将爆发(2026-07-15,2 条)
- 第 11 集:AI开源激辩:封闭能否换来安全(2026-07-15,10 条)
- 第 12 集:多家新模型发布传闻齐出,厂商均未官宣(2026-07-15,7 条)
- 第 13 集:Kimi K3 上线冲榜,开权重逼近前沿(2026-07-15,184 条)
- 第 14 集:Kimi K3 登顶前端代码榜引热议(2026-07-16,53 条)
- 第 15 集:大模型前沿优势窗口仅剩数月(2026-07-16,2 条)
- 第 16 集:Kimi K3 引爆中国前沿模型再评估(2026-07-16,94 条)
- 第 17 集:Kimi K3 性能比肩顶级模型引发 AI 圈热议(2026-07-16,3 条)
- 第 18 集:Kimi K3 实战编码能力引发争论(2026-07-16,6 条)
- 第 19 集:Kimi K3 开权重引爆开放模型争论(2026-07-17,15 条)
- 第 20 集:Kimi K3编码实测接近前沿但体验欠佳(2026-07-17,3 条)
- 【源头】Kimi K3 与 Fable 5 的差距已不像过去那样明显 — FinanceYF5 · 2026-07-21
- 【源头】Kimi K3 pass@4 达到 89.4%,超过 GPT-5.6 Sol — FinanceYF5 · 2026-07-21
- 【源头】Kimi K3 单次 4.65 美元,每美元产出是 Fable 5 的 2.8 倍 — FinanceYF5 · 2026-07-21
- Kimi K3 只在 Go 领先,Fable 5 包揽其余四种语言 — FinanceYF5 · 2026-07-21
- Kimi K3 软件任务峰值 89.4%,Fable 5 稳定性略高 — FinanceYF5 · 2026-07-21
- Kimi K3 与 Fable 5 在软件基准上的失败模式几乎一致 — FinanceYF5 · 2026-07-21