Kimi K3 Kernel 实现超官方 2 倍性能
ChengleiSi · x · 2026-08-19
技术分享显示,针对 Kimi K3 的 KDA 注意力机制,独立编写的 Kernel 在 B200 上实现了比官方 FlashKDA 高 2.05 倍的加速。该 Kernel 已合并至 sglang,包含 23 种形状特化分发选项,是该工作负载下性能最强的开源实现。作者通过研究 flashinfer 代码,揭示了这些 Kernel 的生成原理,内部包含大量冻结的 CUDA 代码和内联 PTX。
「Infra」频道最新
- MCDMA 实现 Spark 与 Mac Studio 直连 — StephanSturges · 2026-08-19
- Cursor 长文复盘 Git 基础设施:把 Origin 当数据库来运营 — vmg · 2026-08-19
- 实战:用 Gemma 4 本地打造企业 RFP 智能体 — victormustar · 2026-08-19
- 向量数据库 Qdrant 下载超 2.5 亿,获 Forrester 认可 — qdrant_engine · 2026-08-19
- Mojo 编程语言正式开源,主打 Python 兼容与极致性能 — mgill25 · 2026-08-19
- Krea 2 训练幕后:张量核心利用率与崩溃哲学 — AI Engineer · 2026-08-19