16 节点 GB10 集群跑满 2.8T 参数 Kimi K3:编码解码 30 tok/s
ciprianveg · reddit · 2026-09-21
一位开发者分享了在自建 16x GB10 集群上部署 Moonshot AI Kimi K3(2.8T 参数) 的实测:
- 编码/解码吞吐:重代码生成与 agentic 任务下持续约 30 tok/s,峰值约 38 tok/s
- Prefill 吞吐:约 750–910 tok/s,通过修改 NCCL 拓扑与双交换机布局优化
- 并发:多用户并发下不丢生成速率、不挤爆 KV cache
- 上下文:稳定支持数十万 token 上下文,多次 500k 压缩的 agentic 工作流
- 网络:双 MikroTik CRS804-4DDQ 交换机,4x 400G 转 4x 100G 分支线
- 运行时:定制 gb10-vllm 栈,使用 dspark / Inferact 的 Kimi-K3-DSPark 封装,带自研 MLA/KV kernel
全部 runtime 补丁、配置和构建脚本已开源在 GitHub(gb10-vllm)。
「Infra」频道最新
- Tobi 称本地 Dell 服务器跑 DeepSeek 4.1 Flash,每秒约 300 tokens — BLUECOW009 · 2026-09-21
- 3060+5060 Ti 双卡张量并行跑 Qwen3.8-27B,实测 50 tok/s — bring_back_the_v10s · 2026-09-21
- Baseten CEO:token 量一年暴涨 40 倍,营收增长约 10 倍 — rohanpaul_ai · 2026-09-21
- AI 不在云端,在地球上:算力扩张的环境代价谁来承担 — SuzannahB1001 · 2026-09-21
- AI 集群新瓶颈不在芯片,而在芯片之间的激光互连 — McDonaghMatthew · 2026-09-21
- 年入将破1亿美元:长文起底SemiAnalysis如何搅动万亿AI基建 — AccBalanced · 2026-09-21