Kimi K3 编码比肩顶尖模型,真实成本引发争议

围绕 Kimi K3 的讨论在 7 月 18 至 19 日集中升温,焦点从单纯的“能力强不强”迅速转向“到底便不便宜”。多位一线开发者认可 K3 在智能体编码(agentic coding)场景中已接近当下顶尖公开模型,但同时也指出它实际 token 消耗很高,使得“更便宜”这一开源卖点在真实任务里站不住脚,开源大模型的性价比叙事因此被重新审视。

能力表现获认可

kuchaev 表示,Kimi 是一个非常出色的模型,在 agentic coding 中基本与 GPT-5.6 持平,这种表现很难简单用“蒸馏”来解释。ssh4net 也称,在自己的观察里,Kimi 在代理编码会话中的表现接近 2026 年第一季度最好的公开模型,同样认为不太像是单纯蒸馏的结果。aniketmaurya 转述了类似判断:该模型在智能体编码任务中基本与 2026 年第一季度最强公开模型相当。

成本不只看单价

Theo 认为,评价 K3 的关键不是“便宜”,而是它与 GPT-5.6 Sol 在真实使用里的总成本大致相近;K3 的单 token 价格约为 GPT-5.6 Sol 的一半,但后者往往使用的 token 也更少。gethackteam 提醒,开发者若只比较每百万 token 单价,会忽略不同模型在同一任务上的 token 效率差异——以 K3 为例,单价虽更优,但 token 消耗远高于 GPT-5.6,实际成本未必占优。ssh4net、aniketmaurya 同样提到 K3 在实际使用中相当消耗 token。

开源卖点的现实拷问

danielmac8 转发的讨论更直接地把问题摆上台面:如果 K3 在 DeepSWE 基准上性能不如闭源的 GPT-5.6,且使用成本更高,那么选择它的理性场景是什么?这触及了开源大模型“低成本”核心卖点在真实评测中面临的挑战。综合本轮讨论形成的共识是:K3 的能力受到肯定,但它是否具备预期中的成本优势,仍需按完整任务的总成本而非标价来判断。

2026-07-18 ~ 2026-07-19 · 6 条相关

事件全程(共 10 集)→

一手来源