千卡实测:H200 集群吞吐优化 Kimi K3 的工程经验
hsu_byron · x · 2026-08-01
作者分享了在 H200 集群上针对 Kimi K3 模型进行高吞吐推理调优的实战经验。主要发现包括:
- TP+EP 优于 DP+EP:由于 K3 仅约 1/4 的层使用门控 MLA,DP attention 规避 KV-cache 重复的收益受限,且会增加延迟。
- FP8 KV cache 表现良好:实测未发现质量或吞吐下降,有效使缓存容量翻倍。
- 扩大并行度提升显著:TP32+EP32 配置相比 TP16+EP16,单副本 KV-cache 容量从约 80 万激增至约 400 万 tokens。
- 低命中率场景建议关闭 radix cache:Prefix caching 需占用更多 Mamba-state slots,关掉可节省内存。
- 高并发下非投机解码胜出:并发超 64 时,投机解码的验证开销超过了其带来的收益。
该配置已在约 1000 张芯片上满载稳定运行数日。作者也指出目前仍存在对称内存导致的不稳定等待解决问题。
「Infra」频道最新
- Taalas 将 Llama 3.1 烧录进定制芯片,推理速度达 1.5 万 tokens/秒 — generativist · 2026-08-01
- 4张5060 Ti本地跑DeepSeek:128k上下文速度实测 — Ambitious_Fold_2874 · 2026-08-01
- 耗时8小时排查ComfyUI黑图问题,揪出PyTorch底层Bug — rtsitola · 2026-08-01
- 韩国7月NAND单价下滑,高利润SSD占比提升 — zephyr_z9 · 2026-08-01
- SGLang 支持 Inkling-Small 本地运行,双节点实现 24 tok/s — ying11231 · 2026-08-01
- macmon:Apple Silicon 终端实时性能监控工具获 1.8k Star — tom_doerr · 2026-08-01