Kimi K3 登顶前端代码榜,编程能力逼近 Fable 5

7 月 18 日至 19 日,Moonshot 新模型 Kimi K3 的编程能力成为社区焦点。Arena 官方宣布 Kimi-K3 在 Frontend Code Arena 取得 1,679 分并升至榜首,使中国模型首次在该前端代码榜上领先美国;转述还称它同时拿下 WebDev 人类偏好榜第一。围绕 DeepSWE、Artificial Analysis 等评测的多篇分析随后展开,核心共识是:Kimi K3 的代码能力已逼近一线闭源模型,而价格约为三分之一。

关键成绩

除 Arena 榜单外,转推还称 Kimi K3 在更接近真实产品开发的终端、长程编码任务上超过 Claude Fable 5 等闭源模型。在 Artificial Analysis 的编程 Agent 指数中,它得分 57,与 GPT-5.6 Terra 等并列第五,领先 Opus 4.8。zephyr_z9 转发的多采样对比显示,Kimi K3 的 pass@1 为 68.5,略低于 Fable 5 的 69.9,但 pass@2 提升至 82.0。

性价比与细分表现

rohanpaul_ai 引用对比图称,在 DeepSWE rollout 任务里按每 100 美元成本计算,Kimi 可完成 14.7 个任务,Fable 5 为 5.3。zhyncs42 转述称,Kimi K3 可把前沿模型推理成本降低约 3 倍,并于 7 月 27 日起在 Together Compute 原生提供。ZainHasan6 进一步拆到语言维度:Rust 任务上极其接近榜首 Fable 并超过 GPT 5.6 Sol,Go 任务上以 79 比 71 击败 Fable。

失败模式与一致性

ZainHasan6 给出逐任务一致性分析:Kimi K3 与 Fable 的相关系数达 0.72,为已见最高的跨厂商相似度;双方都通过 96 个任务,Kimi-only 5,Fable-only 15。他还对比了失败分布,认为两者"失败指纹"几乎一样,约 65% 属于 near miss,且更偏向保守失败而非幻觉式错误。整体来看,这一轮讨论把 Kimi K3 定位为编程场景里兼顾成绩与成本的新竞争者。

2026-07-18 ~ 2026-07-19 · 12 条相关