TokenSpeed 优化 Kimi K3:近千块 B300 上稳定运行三周,GB300 TP8 实战细节公开

zhyncs42 · x · 2026-09-08

开源 LLM 推理引擎 TokenSpeed 发布 Kimi K3 在 GB300 上的优化系列第一篇(TP8,单 NVL72 NVLink 域),已稳定运行 3 周以上,横跨约 1000 块 B300 和 2000 块 H200 GPU。团队感谢 NVIDIA 提供工程支持与 GB300 NVL72 访问权限。

技术要点:以多轮 SWE-Smith trace 为代表负载,基于 EAGLE3 推测解码(lightseekorg/kimi-k3-eagle3-mla)研究并发 1–16 下的解码与验证路径,跟踪总吞吐与单用户生成速度;EAGLE3 在全部并发区间改善吞吐-速度曲线;对两个 LatentMoE 投影做通信感知切分,每卡回收约 7.7 GiB 参数存储并降低尾部延迟;基于重放的 KDA 状态恢复把 maxnumseqs=64 时验证期工作区从 16.7 GiB 降到 0.4 GiB。后续还有专家并行(Part II)等篇章。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →