K3 模型自托管方案:50 万美元配置实现 25 tps 推理性能
Liu_eroteme · x · 2026-07-29
针对 K3 模型(2.8T 参数)的自托管推理,作者提出一套硬件方案:
- CPU: Epyc 9556
- 内存: 16x 256GB DDR5(共 4TB)
- 成本: 约 5 万美元
- 若使用 12800MT/s MRDIMM,可达到约 25 tps 的理论上限(持续批处理约 1-200 tps)
引用 @protosphinx 指出,K3 权重约 1.4T(不含 KV 缓存),Moonshot 建议生产推理至少 64 个加速器。32x H200 集群约 120 万美元,64x 约 240 万美元,运营成本约 1.5 万美元/月。
所属事件:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(8 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23