Kimi K3 被称接近 3 万亿参数,推理要一整柜 64 卡
teortaxesTex · x · 2026-07-21
这条引用帖在聊 Kimi K3 的规模和部署代价:它太大了,几乎需要一整机架的高端芯片才能跑。
原帖与配图里给出的关键信息
- K3 被描述为接近 3 万亿参数;
- 发帖人补充说,实际部署大概需要 一整柜机架,更像是 64 张 GPU 的量级,而不一定非要 72 张;
- 配图中的技术说明写到,Kimi K3 采用 Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes);
- 还使用 Stable LatentMoE,只激活 896 个专家中的 16 个;
- 从 SFT 阶段开始使用 quantization-aware training,权重是 MXFP4,激活是 MXFP8;
- 为了推理效率,官方建议把 Kimi K3 部署在 64 个或更多加速器 的 supernode 配置上;
- 同时还提到会提供对应的 vLLM 实现,并借助 KDA + prefill cache 在规模和长上下文下维持有竞争力的 token 成本。
整体看,这是一条把模型架构信息和基础设施部署要求绑在一起的帖子。
所属事件:Moonshot 发布 2.8T 开源模型 Kimi K3(14 条相关)→
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11