Kimi K3 Kernel 实现超官方 2 倍性能

ChengleiSi · x · 2026-08-19

技术分享显示,针对 Kimi K3 的 KDA 注意力机制,独立编写的 Kernel 在 B200 上实现了比官方 FlashKDA 高 2.05 倍的加速。该 Kernel 已合并至 sglang,包含 23 种形状特化分发选项,是该工作负载下性能最强的开源实现。作者通过研究 flashinfer 代码,揭示了这些 Kernel 的生成原理,内部包含大量冻结的 CUDA 代码和内联 PTX。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →