Novita 开源 Chord W4A16 MoE 内核,Kimi K2.x 推理最高提速 2.15x
vllm_project · x · 2026-09-16
Novita AI 联合 vLLM 团队开源了 Chord,一个面向 Kimi K2.x 推理场景的高性能 W4A16 MoE CUDA 算子(BF16 激活、INT4 权重、group-32 scale)。
核心设计思路是:没有一种 MoE 内核能适配所有请求——prefill 与 decode 阶段每专家路由的 token 数相差数个量级,因此 Chord 提供了索引路径(indexed)与分组路径(grouped)两种实现。索引路径兼容 vLLM 的 Humming 后端(通过 --quantization humming 启用,需兼容的 vLLM 版本),分组路径集成仍在开发中。
实测性能(逐层与公开版 Humming 对比):
- H200 EP8 prefill 提速 1.11–1.20x;H200 TP8 单实例 serving 达 1.17–1.33x
- H200 EP8 decode 提速 1.16–1.24x,其中 down 阶段最高 1.31x
- B300 EP8 decode 对 Humming 未调优默认配置最高达 2.15x(公开版 Humming 尚无 SM100/SM103 调优表)
- 分组路径在 H200 EP8/EP16/EP32 各场景提速约 1.00–1.35x
内核与完整 benchmark 表格均已开源,详见 vLLM 官方博客。
「Infra」频道最新
- 德国算力困局:黑森州电力需求或增三倍,DFKI研发省电AI — FlorianGallwitz · 2026-09-16
- 投资人:GPU 短缺实为资本准入问题,押 30% 首付即稳赚 — sarahdrinkwater · 2026-09-16
- 开发者为 Haiku 系统实现 Linux 子系统,支持 OCI 运行时与容器 — unixterminal · 2026-09-16
- Anthropic 租下澳洲昆士兰数据中心园区,2027 年投运 — DigitalColmer · 2026-09-16
- Transformers 模型可直接在 vLLM 运行,无需移植转换 — pcuenq · 2026-09-16
- 台积电建 20 座厂仍追不上 AI 需求,劳动力短缺成瓶颈 — emmanuelvivier · 2026-09-16