开源 KDA-B200 内核在 Blackwell 上最高提速 1.59 倍
xennygrimmato_ · x · 2026-07-28
INT21-AI 开源了 KDA-B200,这是一个面向 NVIDIA Blackwell GPU 的前向版 Kimi Delta Attention 实现。
- 代码用普通 CUDA C++ 和 PTX 编写,不依赖 CUTLASS 或 CUTE 的构建/运行时;
- 仓库宣称在 6 种同机场景下,相比基于 CUTLASS 的 FlashKDA 路径,几何平均速度提升 1.42×;
- 在文中给出的基准里,最高可到 1.59×;
- 实现已在 NVIDIA B200 上验证,目标硬件是 sm100a。
这是一个典型的算子/内核性能公告,重点在 Blackwell 级硬件上的吞吐优化。
所属事件:面向 Blackwell 的开源 PTX KDA 内核发布(2 条相关)→
「Infra」频道最新
- DeepSeek 发布 DSec:单集群日均跑 300 万智能体训练环境 — jiqizhixin · 2026-09-23
- DeepSeek 发布 DSec:日跑 300 万 agent 环境,每秒新建 5000 沙箱 — jiqizhixin · 2026-09-23
- 高通押注 AI Agent 优先:发布骁龙 8 Elite Gen 6 及多款 Agent 设备 — jiqizhixin · 2026-09-23
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23