TokenSpeed 优化 Kimi K3:近千块 B300 上稳定运行三周,GB300 TP8 实战细节公开
zhyncs42 · x · 2026-09-08
开源 LLM 推理引擎 TokenSpeed 发布 Kimi K3 在 GB300 上的优化系列第一篇(TP8,单 NVL72 NVLink 域),已稳定运行 3 周以上,横跨约 1000 块 B300 和 2000 块 H200 GPU。团队感谢 NVIDIA 提供工程支持与 GB300 NVL72 访问权限。
技术要点:以多轮 SWE-Smith trace 为代表负载,基于 EAGLE3 推测解码(lightseekorg/kimi-k3-eagle3-mla)研究并发 1–16 下的解码与验证路径,跟踪总吞吐与单用户生成速度;EAGLE3 在全部并发区间改善吞吐-速度曲线;对两个 LatentMoE 投影做通信感知切分,每卡回收约 7.7 GiB 参数存储并降低尾部延迟;基于重放的 KDA 状态恢复把 maxnumseqs=64 时验证期工作区从 16.7 GiB 降到 0.4 GiB。后续还有专家并行(Part II)等篇章。
「Infra」频道最新
- 高通确认 AWS 合作已计入 FY29 150 亿美元数据中心营收目标 — BenBajarin · 2026-09-08
- 数据中心建设开支半年暴增250亿美元,招聘岗位重回30万+ — AccBalanced · 2026-09-08
- 算力金融化狂飙:GPU租赁CDO或将上市 — AccBalanced · 2026-09-08
- Citi 会议要点:超大规模商积压订单近 1.7 万亿美元,AI 资本开支剑指 3.8 万亿 — sanjaykalra · 2026-09-08
- AI 数据中心互联芯片公司 Celero 融资 2.75 亿美元,估值超 30 亿 — dinabass · 2026-09-08
- vLLM 生态 Speculators v0.8.0 发布:统一 CLI 与 Triton 融合损失核 — vllm_project · 2026-09-08