Kimi K3 编码比肩顶尖模型,真实成本引发争议
围绕 Kimi K3 的讨论在 7 月 18 至 19 日集中升温,焦点从单纯的“能力强不强”迅速转向“到底便不便宜”。多位一线开发者认可 K3 在智能体编码(agentic coding)场景中已接近当下顶尖公开模型,但同时也指出它实际 token 消耗很高,使得“更便宜”这一开源卖点在真实任务里站不住脚,开源大模型的性价比叙事因此被重新审视。
能力表现获认可
kuchaev 表示,Kimi 是一个非常出色的模型,在 agentic coding 中基本与 GPT-5.6 持平,这种表现很难简单用“蒸馏”来解释。ssh4net 也称,在自己的观察里,Kimi 在代理编码会话中的表现接近 2026 年第一季度最好的公开模型,同样认为不太像是单纯蒸馏的结果。aniketmaurya 转述了类似判断:该模型在智能体编码任务中基本与 2026 年第一季度最强公开模型相当。
成本不只看单价
Theo 认为,评价 K3 的关键不是“便宜”,而是它与 GPT-5.6 Sol 在真实使用里的总成本大致相近;K3 的单 token 价格约为 GPT-5.6 Sol 的一半,但后者往往使用的 token 也更少。gethackteam 提醒,开发者若只比较每百万 token 单价,会忽略不同模型在同一任务上的 token 效率差异——以 K3 为例,单价虽更优,但 token 消耗远高于 GPT-5.6,实际成本未必占优。ssh4net、aniketmaurya 同样提到 K3 在实际使用中相当消耗 token。
开源卖点的现实拷问
danielmac8 转发的讨论更直接地把问题摆上台面:如果 K3 在 DeepSWE 基准上性能不如闭源的 GPT-5.6,且使用成本更高,那么选择它的理性场景是什么?这触及了开源大模型“低成本”核心卖点在真实评测中面临的挑战。综合本轮讨论形成的共识是:K3 的能力受到肯定,但它是否具备预期中的成本优势,仍需按完整任务的总成本而非标价来判断。
2026-07-18 ~ 2026-07-19 · 6 条相关
- 第 1 集:Kimi K3 编码比肩顶尖模型,真实成本引发争议(2026-07-18,6 条)
- 第 2 集:Kimi-K3登顶LisanBench开源最强模型(2026-07-18,2 条)
- 第 3 集:实测Kimi K3生成游戏首稿胜过GPT-5.5(2026-07-18,2 条)
- 第 4 集:Kimi K3 编程与3D推理惊艳亮相,实测击败多款SOTA(2026-07-18,5 条)
- 第 5 集:Kimi K3 评测成绩两极分化,工具链影响显著(2026-07-18,5 条)
- 第 6 集:Kimi K3 架构预告:主打原生创新与注意力残差(2026-07-19,3 条)
- 第 7 集:Kimi-K3 初步 ECI 评测分数曝光,或超多家顶级模型(2026-07-19,4 条)
- 第 8 集:Kimi K3 在 Harvey 法律基准领跑(2026-07-19,4 条)
- 第 9 集:Moonshot 发布 2.8T 开源模型 Kimi K3(2026-07-19,14 条)
- 第 10 集:Kimi K3 开源模型冲进全球前三,与闭源差距缩至4分(2026-07-28,5 条)
一手来源
- Kimi K3 未必更省钱 — theo ·
- Kimi模型实测:编码能力达顶尖,但可能并不便宜 — kuchaev ·
- Kimi 在代理编码中表现很强 — ssh4net ·
- 【源头】Kimi K3 未必更省钱 — theo · 2026-07-18
- 开源模型性价比之问:Kimi K3 比 GPT-5.6 贵且弱? — daniel_mac8 · 2026-07-18
- 别被Token单价骗了:Kimi K3实际成本可能更高 — gethackteam · 2026-07-18
- 【源头】Kimi模型实测:编码能力达顶尖,但可能并不便宜 — kuchaev · 2026-07-18
- Kimi模型在智能体编码中表现亮眼 — aniketmaurya · 2026-07-19
- 【源头】Kimi 在代理编码中表现很强 — ssh4net · 2026-07-19