开源 KDA-B200 内核在 Blackwell 上最高提速 1.59 倍
xennygrimmato_ · x · 2026-07-28
INT21-AI 开源了 KDA-B200,这是一个面向 NVIDIA Blackwell GPU 的前向版 Kimi Delta Attention 实现。
- 代码用普通 CUDA C++ 和 PTX 编写,不依赖 CUTLASS 或 CUTE 的构建/运行时;
- 仓库宣称在 6 种同机场景下,相比基于 CUTLASS 的 FlashKDA 路径,几何平均速度提升 1.42×;
- 在文中给出的基准里,最高可到 1.59×;
- 实现已在 NVIDIA B200 上验证,目标硬件是 sm100a。
这是一个典型的算子/内核性能公告,重点在 Blackwell 级硬件上的吞吐优化。
所属事件:面向 Blackwell 的开源 PTX KDA 内核发布(2 条相关)→
「Infra」频道最新
- Kimi K3 据称跑在 80 张 RTX 5090 上,合计 2.56TB 显存 — sandyyevans · 2026-07-28
- AWS 展示安全云沙箱,可分析 ABCD 与 HBCD 脑数据 — bttyeo · 2026-07-28
- Nvidia、Google、AMD 和 Amazon 吃下大部分 CoWoS 与 HBM 需求 — Beth_Kindig · 2026-07-28
- Workshop 演示如何用 DuckDB 分析 Claude Code Trace — Al_Grigor · 2026-07-28
- 马斯克称 Grok 下一轮 2T 训练将使用 SpaceX 工程数据 — burhop · 2026-07-28
- AutoScientist API 上线,主打自动适配数据和免费三次训练 — sarahookr · 2026-07-28