Kimi K3 开源权重 2.8 万亿,单机根本跑不动
ArtificialAnlys · x · 2026-07-29
本地跑 Kimi K3 需要数据中心级硬件
Artificial Analysis 认为,Kimi K3 比近期开源权重旗舰如 GLM-5.2 难部署得多,甚至是首个在单个 Hopper 节点上连 4-bit 量化都放不下的开源权重模型。
关键信息
- 总参数 2.8 万亿,是目前最大的开源权重模型。
- 按原生 MXFP4 计算,光权重就要占用约 1560 GB 显存,还没开始服务 token。
- 其混合注意力机制降低了 KV cache 压力;在 GB300 NVL72 上,若只看容量不看吞吐,256K 上下文理论上可支持 2000+ 并发请求,而 Kimi K2.6 约为 1000。
- 但即便只给单用户跑 256K 上下文,仍需约 1570 GB 内存;若使用 16-bit KV cache,每增加一个并发用户还要再加约 8 GB。
- 综合看,整套系统成本会到几十万美元量级,具体取决于硬件配置和采购价格。
可行硬件配置
文章给出的可行方案包括:8× B300 / GB300、16× B200 / GB200,以及 AMD 的 8× MI355X / MI455X。
Artificial Analysis 还表示会很快发布首日推理基准,并持续跟踪推理栈成熟后性能的变化。
所属事件:Kimi K3 开源 2.8 万亿参数推高算力门槛(3 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23