Kimi K3 被称接近 3 万亿参数,推理要一整柜 64 卡
teortaxesTex · x · 2026-07-21
这条引用帖在聊 Kimi K3 的规模和部署代价:它太大了,几乎需要一整机架的高端芯片才能跑。
原帖与配图里给出的关键信息
- K3 被描述为接近 3 万亿参数;
- 发帖人补充说,实际部署大概需要 一整柜机架,更像是 64 张 GPU 的量级,而不一定非要 72 张;
- 配图中的技术说明写到,Kimi K3 采用 Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes);
- 还使用 Stable LatentMoE,只激活 896 个专家中的 16 个;
- 从 SFT 阶段开始使用 quantization-aware training,权重是 MXFP4,激活是 MXFP8;
- 为了推理效率,官方建议把 Kimi K3 部署在 64 个或更多加速器 的 supernode 配置上;
- 同时还提到会提供对应的 vLLM 实现,并借助 KDA + prefill cache 在规模和长上下文下维持有竞争力的 token 成本。
整体看,这是一条把模型架构信息和基础设施部署要求绑在一起的帖子。
所属事件:Moonshot 发布 2.8T 开源模型 Kimi K3(14 条相关)→
「Infra」频道最新
- 中国 AI 军备竞赛正被芯片、数据中心和开源模型定义 — BenBajarin · 2026-07-22
- Agent 搜索瓶颈正在从速度转向延迟稳定性 — rohanpaul_ai · 2026-07-22
- Gavin Baker:Nvidia 可能是开源 AI 最大支持者之一 — GavinSBaker · 2026-07-22
- AI 算力需求刺破美国能源缺口,呼吁打破稀缺重建产能 — bradneuberg · 2026-07-22
- Gavin Baker 指出,6300 亿美元是系统收入,不全归 Nvidia — GavinSBaker · 2026-07-22
- 一个基于 Firecracker 的平台称可在 256 GB 服务器上跑 6000 个 AI agent — maritime_sh · 2026-07-22