专题 · FULL STORY

Kimi K3开源:从部署到极限压测

月之暗面开源2.8万亿参数模型Kimi K3,引发基础设施热潮。vLLM等平台迅速提供Day-0支持,开发者们随后在消费级硬件与云服务上展开极限部署与算力账本实测,不断刷新推理极限。

2026-07-27 ~ 2026-07-31 · 9 集 · 51 条

第 1 集 · vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(2026-07-27,11 条)

vLLM 表示,Moonshot AI 的 Kimi K3 在权重公开后即可在其栈上实现 day-0 推理部署,并已发布面向生产环境的部署指南与技术详解。此次重点不只是 K3 具备 2.8 万亿参数、100 万 token 上下文和原生视觉能力,更在于 vLLM 给出了针对超大 MoE 的服务化方案:其认为真正难点是缓存而非参数量,并通过推测解码把单流吞吐提升到 370 tok/s。对行业而言,这展示了开源推理栈如何快速适配架构特殊的超大模型。

已确认

  • vLLM 将 Kimi K3 描述为 2.8T 参数的 MoE 模型,每个 token 激活 16/896 个专家,支持 1M 上下文窗口,具备原生视觉能力,并采用 Kimi Delta Attention(KDA)架构。
  • vLLM 认为,部署 K3 时最棘手的并不是 2.8T 参数本身,而是如何高效缓存。其解释称,K3 的许多层使用固定大小的 KDA state,而不是会随 token 增长的 KV cache,因此不需要处理传统按 token 递增的 KV 哈希增长问题,缓存压力更小。
  • 为了在超大参数规模下兼顾低延迟与精度,Inferact 为 Kimi K3 训练并开源了 Kimi-K3-DSpark 草稿模型。vLLM 称该模型是面向 vLLM 的 MLA-native 方案,训练数据复用了 vLLM 自身抽取的 target hidden states,从而实现缓存复用;结合推测解码后,单流吞吐达到 370 tok/s。
  • vLLM 还列出了 K3 当前可用的服务能力,包括 P/D disaggregation、prefix caching、KV offload,以及按拓扑选择的 MoE backend,例如 EP 场景使用 megamoe、TP>1 场景使用 trtllm。

为什么重要

对 2.8T 级别的 MoE 来说,能否稳定、低延迟地在线服务,关键往往在系统工程而非纸面参数规模。vLLM 这次公开的 KDA state 缓存思路,以及通过复用隐藏状态训练草稿模型的做法,为后续超大 MoE 的开源部署提供了可参考的工程路径。

第 2 集 · Fireworks 平台上线 Kimi K3 推理与多维微调功能(2026-07-28,2 条)

开源大模型 Kimi K3 现已全面接入 Fireworks AI 平台,支持开发者进行推理与训练。用户不仅可以通过 LoRA 适配器对该前沿模型进行便捷微调,还能利用平台的 Training API 执行监督微调、偏好微调以及强化学习。此举进一步降低了开源大模型的应用与定制门槛。

第 3 集 · Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(2026-07-28,8 条)

开源模型Kimi K3(2.8万亿参数)据称已成功部署在由80张RTX 5090组成的消费级GPU集群上,单流吞吐量约20 tok/s,完全无需HBM显存。该方案使用官方FP4(MXFP4)权重,未重新量化,是首个在纯消费级硬件上运行的前沿大模型案例,打破了高端AI推理对数据中心级专用硬件的依赖。

已确认

  • 硬件配置:集群共80张RTX 5090,分为10个节点,每节点8卡,合计2.56TB显存。
  • 网络与带宽:节点间使用25GbE以太网连接,未采用InfiniBand。
  • 模型与性能:Kimi K3拥有2.8万亿参数,使用官方FP4权重,单流吞吐约20 tok/s。
  • 自建替代方案:作者@Liueroteme提出EPYC 9556 CPU + 16x 256GB DDR5(共4TB内存)方案,总成本约5万美元;若配备12800MT/s MRDIMM,带宽可达1.6TB/s,推理性能有望达25 TPS。

尚未确认

  • 帖子提及Kimi K3与GLM-5.2据称将很快开放“Mining”(挖矿)模式,目前尚属传闻。

为什么重要

  • 这是首个在纯消费级硬件上成功运行的前沿开源大模型案例,打破了高端AI推理对数据中心级专用硬件的绝对依赖,为低成本部署超大参数模型提供了新思路。
  • 随着顶级开源模型权重稳定在3T左右,5万美元级别的自建服务器有望成为普通家庭可负担的选择。作者@Liueroteme将其比作家庭购买第二辆车的开销,预示着顶级AI算力未来可能向家庭场景普及。

第 4 集 · Kimi K3 开放权重发布,引爆开源与基础设施讨论(2026-07-28,5 条)

Kimi K3 以开放权重形式发布后,迅速在 Hugging Face 冲上热门榜前列,并被推理服务商、编程 Agent 及各类 AI 应用快速接入。AI 领域知名博主 Elvis Saravia (omarsar0) 认为,Kimi K3 的惊艳表现证明了开源权重模型的实力,业界不应再视而不见,建议开发者和企业逐步引入开源模型。然而,开发者 steipete 指出大模型推理服务很难,强调如果没有便宜且可用的 API 端点(例如他期望能有 5 美元的 Kimi-K3 API),就很难让人兴奋,真正的痛点在于基础设施层面。此外,硅谷围绕“开源与闭源”以及“开放权重是否安全”展开了激烈争论。

已确认

  • Kimi K3 以开放权重形式发布,并迅速冲上 Hugging Face 热门榜前列。
  • 该模型已被推理服务商、编程 agent 和各类 AI 应用快速接入。
  • 开放权重允许开发者下载、微调、审计模型,有助于提升效率、能力、适用性与安全性。

观点与争议

  • Elvis Saravia (omarsar0) 认为 Kimi K3 表现惊艳,证明开源权重模型的实力,业界不应忽视。
  • steipete 指出推理服务成本高,缺乏便宜可用的 API 端点(如 5 美元的 Kimi-K3 API)是痛点。
  • 硅谷围绕开放权重安全性展开争论。

为什么重要

Kimi K3 的走红标志着开源模型在核心能力上已具备极强竞争力,足以撼动现有技术栈选择。然而,要将其能力转化为广泛的实际生产力,行业仍需克服推理服务成本与基础设施稳定性的挑战。

第 5 集 · 算力账本:Kimi K3 自托管百天内回本(2026-07-28,4 条)

近期关于 Kimi K3 模型自托管经济账的讨论引发关注。分析指出,虽然搭建环境需先投入约 60 万美元购买 8 张 B300 芯片,但通过优化算法可节省超 60% 的算力。在 75% 利用率下,该系统每月可承载超 300 亿 tokens,预计不到 100 天即可收回成本,使本地部署成为替代企业 API 的可行方案。

第 6 集 · 极客尝试在 Mac 设备本地量化运行 K3 大模型(2026-07-29,2 条)

针对庞大的 K3 模型权重,开发者们正在探索本地与近端推理方案。测试发现,在 M5 Max 128GB 上流式加载 1.6TB 的官方权重依然缓慢;但通过量化手段,使用两台 512GB 内存的 Mac Studio 跑 Q2 精度,已能在聊天场景中达到可接受的响应速度,证明了量化运行的可行性。

第 7 集 · Kimi K3 开源 2.8 万亿参数推高算力门槛(2026-07-29,3 条)

月之暗面开源的 Kimi K3 拥有约 2.8 万亿参数,引发了业界对其极高部署门槛的关注。分析指出,该模型无法在 Mac mini 等个人设备上本地运行,而是需要数据中心级别的硬件支持。这反映出一个反直觉的趋势:更强的开源模型非但没有降低算力需求,反而因其庞大的体量成为了推动算力消耗进一步增长的重要信号。

第 8 集 · vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2026-07-29,2 条)

vLLM 公布了 Kimi K3 模型的最新推理吞吐测试结果。在低熵推理负载下,系统借助 DSpark 优化,于 4 台 GB300 服务器(4×4 GPU 配置)上,将 batch size 设为 1 时的 decode 峰值速度大幅提升至 464 tok/s,展现了顶尖硬件结合软件优化的强劲性能。

第 9 集 · Kimi K3开源首日获vLLM及AMD等多平台支持(2026-07-30,14 条)

Moonshot AI 开源了 2.8 万亿参数的混合专家模型 Kimi K3,vLLM 在发布首日即提供生产级推理支持,最低仅需 8 张 B300 显卡即可运行完整模型,并原生支持 AMD ROCm 生态。模型已上线 DigitalOcean、Modal、Baseten 等云平台,开发者可快速部署生产级 API。此举大幅降低了超大规模开源模型的部署门槛,并打破了单一硬件生态的限制。

已确认

  • 模型架构:Kimi K3 总参数量 2.8 万亿,采用 MoE 架构,每 Token 激活 16 个专家,支持 100 万 Token 上下文窗口和原生视觉能力。
  • 硬件部署:vLLM 确认跑起该模型最低只需 8 张 B300 显卡,并适配英伟达 Grace Blackwell、Blackwell、Hopper 和 NVL72 等多代系统,集成 Dynamo 保障高效运行。
  • AMD 生态支持:vLLM 原生支持 AMD ROCm,完整模型可在 Instinct 系列硬件上部署。AMD 高管 Anush Elangovan 确认通过合作在 Day 0 支持了 Kimi K3 及 MI355X 等硬件,并强调“速度就是护城河”。
  • 云平台部署:Kimi K3 已上线 DigitalOcean、Modal 和 Baseten 平台,由 vLLM 提供底层推理服务,开发者可快速部署生产级 API 端点。
  • 推理性能:TensorWave 指出,通过 AMD 生态适配,RadixArk 的 DSPARK 运行该模型实现了 423 TPS 的吞吐量。

为什么重要

  • 降低部署门槛:2.8 万亿参数模型对显存要求极高,vLLM 的高效支持使仅需 8 张 B300 即可运行,极大降低了超大规模模型的算力成本。
  • 打破硬件垄断:首日原生支持 AMD ROCm 生态,为开发者提供了 NVIDIA 之外的强力替代方案,加速了 AI 推理硬件生态的多元化。