专题 · FULL STORY

Kimi K3:从架构预告到开源冲进全球前三

月之暗面发布2.8万亿参数开源模型Kimi K3。该模型在发布前后经历了架构预告、多领域实测击败SOTA,最终在智能指数中缩小与闭源模型差距,冲进全球前三。

2026-07-18 ~ 2026-07-30 · 10 集 · 50 条

第 1 集 · Kimi K3 编码比肩顶尖模型,真实成本引发争议(2026-07-18,6 条)

围绕 Kimi K3 的讨论在 7 月 18 至 19 日集中升温,焦点从单纯的“能力强不强”迅速转向“到底便不便宜”。多位一线开发者认可 K3 在智能体编码(agentic coding)场景中已接近当下顶尖公开模型,但同时也指出它实际 token 消耗很高,使得“更便宜”这一开源卖点在真实任务里站不住脚,开源大模型的性价比叙事因此被重新审视。

能力表现获认可

kuchaev 表示,Kimi 是一个非常出色的模型,在 agentic coding 中基本与 GPT-5.6 持平,这种表现很难简单用“蒸馏”来解释。ssh4net 也称,在自己的观察里,Kimi 在代理编码会话中的表现接近 2026 年第一季度最好的公开模型,同样认为不太像是单纯蒸馏的结果。aniketmaurya 转述了类似判断:该模型在智能体编码任务中基本与 2026 年第一季度最强公开模型相当。

成本不只看单价

Theo 认为,评价 K3 的关键不是“便宜”,而是它与 GPT-5.6 Sol 在真实使用里的总成本大致相近;K3 的单 token 价格约为 GPT-5.6 Sol 的一半,但后者往往使用的 token 也更少。gethackteam 提醒,开发者若只比较每百万 token 单价,会忽略不同模型在同一任务上的 token 效率差异——以 K3 为例,单价虽更优,但 token 消耗远高于 GPT-5.6,实际成本未必占优。ssh4net、aniketmaurya 同样提到 K3 在实际使用中相当消耗 token。

开源卖点的现实拷问

danielmac8 转发的讨论更直接地把问题摆上台面:如果 K3 在 DeepSWE 基准上性能不如闭源的 GPT-5.6,且使用成本更高,那么选择它的理性场景是什么?这触及了开源大模型“低成本”核心卖点在真实评测中面临的挑战。综合本轮讨论形成的共识是:K3 的能力受到肯定,但它是否具备预期中的成本优势,仍需按完整任务的总成本而非标价来判断。

第 2 集 · Kimi-K3登顶LisanBench开源最强模型(2026-07-18,2 条)

在LisanBench评测中,Kimi-K3成为当前最强的开源权重模型,其整体表现优于Gemini 3等模型,在标准指标排名第5、难度加权指标排名第4。不过,也有反馈指出其运行成本相对偏高。

第 3 集 · 实测Kimi K3生成游戏首稿胜过GPT-5.5(2026-07-18,2 条)

开发者使用开源模型Kimi K3 Standard测试生成独立太空飞船游戏,并将其与闭源模型进行对比。实测结果显示,Kimi K3的首版生成效果明显优于GPT-5.5的初稿,表现令人瞩目。

第 4 集 · Kimi K3 编程与3D推理惊艳亮相,实测击败多款SOTA(2026-07-18,5 条)

近期,Kimi K3 模型在编程、3D 推理及 Agent 能力上展现出极其优异的表现,引发了技术圈的高度关注与热烈讨论。不仅在多项严苛的横向评测中击败了当前的主流 SOTA 模型,其展现出的空间智能潜力更让业界对其在具身智能等物理世界交互场景的应用充满期待。

盲测与实测表现

在 3D 渲染与代码生成的盲测中,Kimi K3 展现了统治级的表现。据 @MaziyarPanahi 的测试,在要求仅用单个 HTML 文件和 three.js 生成完整 3D 世界的任务里,Kimi K3 击败了 GLM-5.2 和 Opus 4.8。测试过程由盲评模型 Qwen3-VL 在不知晓模型出处的情况下打分,K3 的渲染效果胜出。此外,@karminski3 对 K3 进行了全方位编程实测,指出其迅速淘汰了前端测试集,后端向量数据库测试也仅剩少数未通过,整体编程与 Agent 能力均属顶尖梯队。

空间智能与行业反响

K3 的强大 3D 构建能力不仅限于 voxel art,@DeryaTR 认为这种“空间智能”上升到认知基础层面,与世界模型、具身智能及机器人理解物理世界的方向高度契合。由于模型表现过于惊艳,技术从业者 @xjdr 在体验后给出了极高评价,并强烈呼吁获取模型权重,以便在自有推理栈上进行本地部署。

第 5 集 · Kimi K3 评测成绩两极分化,工具链影响显著(2026-07-18,5 条)

Moonshot(月之暗面)的 Kimi K3 模型近期在 AI 社区引发了广泛的评测与讨论。该模型在不同基准测试中的成绩呈现出显著的两极分化,这不仅凸显了当前 AI 评测体系的复杂性,也让外界开始高度关注测试工具链对大模型实战表现的干预程度。

关键细节与表现分化

Kimi K3 的成绩呈现出明显的两极分化。一方面,据 @ChrisUniverse 提供的数据,K3 在 Arena Frontend Code 排名第 1,得分 1679。但另一方面,其在 FrontierMath Tier 4 基准测试中得分仅为 39%(@scaling01),比 7 个月前美国最好的模型还要低 7%。此外,在真实代码修复测试中,K3 的表现甚至垫底(@ChrisUniverse),这与外界关于其“代码能力很强”的说法并不一致。

评测工具链与 Harness 的影响

针对实战表现的争议,多位作者指出测试工具链(harness)对 K3 的成绩影响巨大。@victormustar 强调,同一个任务换不同评测框架,K3 的效果可能从“糟糕得离谱”变成接近 Fable 级别,并在 Boeing 747 相关任务中给出惊艳结果。在具体的代码修复对比中(@ssh4net 转发),Kimi K3 和 Fable 5 都能修复真实 Bug,但 Fable 5 效率更高,耗时 3.5 分钟、调用工具 18 次。

观点与解读

针对 K3 在数学评测上的低分,@teortaxesTex 反驳了“中文模型趋势不行”的判断。他认为,前沿数学题正是中国模型容易落后的领域,该低分主要拖累了模型的 ECI 估计,但他预测中国模型往往会在下一个版本中迅速补齐短板。

第 6 集 · Kimi K3 架构预告:主打原生创新与注意力残差(2026-07-19,3 条)

Kimi 与 Moonshot 近期披露了新一代 K3 模型的架构预告,引发社区热议。多方讨论强调,K3 并非简单的“蒸馏版”,而是具备实质性原生创新。其核心技术包括用于高效扩展长上下文的 KDA 混合线性注意力,以及能提供更高效记忆检索机制的注意力残差。

第 7 集 · Kimi-K3 初步 ECI 评测分数曝光,或超多家顶级模型(2026-07-19,4 条)

Kimi-K3 模型的初步 ECI(有效编码智能)得分曝光,稳定在 155.5 左右(90% 置信区间为 153.87 至 158.21)。该分数不仅微弱领先于 Opus 4.6 和 GPT 等顶级模型,更引发了社区热议。有讨论指出,若此成绩属实,Kimi-K3 的表现将超越 Google、Meta 和 xAI 目前可用的最强模型。

第 8 集 · Kimi K3 在 Harvey 法律基准领跑(2026-07-19,4 条)

在面向自主法律工作的 Harvey LAB-AA 基准测试中,Kimi K3 以 26.7% 的 all-pass rate 位居第一,显著高于第二名 Claude Fable 5 的 14.2%。相关帖文称,该测试覆盖 24 个法律领域,显示 Kimi K3 在高难度法律任务上的领先表现。

第 9 集 · Moonshot 发布 2.8T 开源模型 Kimi K3(2026-07-19,14 条)

Moonshot AI 发布了总参数达 2.8 万亿的开源权重 MoE 模型 Kimi K3。该模型支持 100 万 token 上下文与原生多模态输入,并默认开启推理模式。K3 的发布大幅缩短了开源大模型与闭源前沿的差距,被视为开源生态进化的重要里程碑。

架构创新与效率提升

根据 @AhmadAlDahle 分享的技术细节,K3 实现了相比 K2 效率提升 2.5 倍的突破。其核心架构创新包括:KDA 机制将 Gated DeltaNet 的单标量衰减替换为可学习的按维度遗忘机制;AttnRes 实现了跨深度选择性检索;并采用了 16/896 的 MoE 架构。@zephyrz9 补充称,K3 按 fp4 精度服务后折算规模约 1.4T,稀疏度仅为 1.7%,是市场上最稀疏的前沿模型之一。

性能与行业影响

结合 Artificial Analysis 的数据,@ImaginaryRea1ity 指出 K3 将开源前沿与闭源前沿的差距缩短至约 1.5 个月。@PeterDiamandis 表示 K3 在前端编程、营销、设计及数据分析等多个任务中冲到第一。行业层面,@AhmadAlDahle 认为如果开源实验室能保持此效率提升速度,纯堆砌算力的优势将迅速贬值。@mishig25 转发研究者 Nathan Lambert 的观点指出,中国实验室已占据最聪明模型前 8 名中的 3 席,重塑了前沿 AI 格局。@emollick 与 @markjeffrey 也提到,前沿开源权重模型如今几乎只剩中国在做,美国和欧洲都缺乏继续投入的动力,连前 OpenAI CTO 创办的公司(Inkling)也难以在短期内追赶。

商业潜力与部署门槛

商业落地方面,@zephyrz9 分析认为其推理业务至少有 75%–80% 的毛利空间。然而,K3 庞大的体积带来了极高的硬件门槛。@teortaxesTex 提到,实际部署该模型可能需要一整柜机架的 64 张高端芯片才能运行。此外,@davidyin44 转述了 Nathan Lambert 的观点,强调 K3 的开源策略实质上升级了大模型开源权重的竞争战局。

第 10 集 · Kimi K3 开源模型冲进全球前三,与闭源差距缩至4分(2026-07-28,5 条)

Moonshot AI 最新开源模型 Kimi K3 在 Artificial Analysis 智能指数中表现亮眼,以 57 分的成绩冲进全球前三,证明了开源权重模型已具备与闭源前沿模型抗衡的实力。

已确认

  • 榜单成绩:在 Artificial Analysis 智能指数排行榜中,Kimi K3 取得 57 分,位居全球第三。目前榜首为 GPT-5.6 Sol,Opus 5 也位列前排且性能压过 Fable 5,但价格仅为一半。
  • 差距缩小:Artificial Analysis 确认,Kimi K3 让开源权重模型与领先闭源模型之间的差距缩小到了 4 分,这是自今年 2 月 GLM-5 发布以来的最小差距。
  • 技术解读:据 bycloud 对 Kimi K3 技术报告的解读,开源与闭源的差距正在急剧缩小,该模型展示了开源追赶闭源的有效路径。

为什么重要

  • 开源生态里程碑:FuSheng0306 认为,当前 AI 圈模型竞争异常激烈,Kimi K3 以开放权重杀入世界前三,标志着开源阵营在顶级大模型竞赛中取得了实质性的突破。
  • 行业趋势参考:同期 Artificial Analysis 还发布了 2025 年度 AI 状态与趋势报告(涵盖模型智能进展与 GPQ 等维度),进一步印证了当前大模型性能飞速迭代、开闭源激烈交锋的行业大趋势。