月之暗面开源 FlashKDA,称 H20 预填充提速最高 2.22 倍
ctjlewis · x · 2026-07-27
月之暗面开源了 FlashKDA,这是一个基于 CUTLASS 的高性能 Kimi Delta Attention 内核实现。
- 它可以作为 flash-linear-attention 的直接替换后端使用。
- 官方给出的结果显示,在 H20 上相较于 flash-linear-attention 基线,prefill 速度提升 1.72×–2.22×。
- 仓库说明里的环境要求包括 SM90+、CUDA 12.9+ 和 PyTorch 2.4+。
「Infra」频道最新
- Kimi K3 接入 SGLang,首日跑到 423 tok/s — ying11231 · 2026-07-28
- Claude 对话被索引后,机密计算方案被再次推上台面 — bittingthembits · 2026-07-27
- Moonshot 开源 MoonEP,开闭源之争再被点燃 — KyeGomezB · 2026-07-27
- Kimi K3 登陆 Nebius:100 万上下文、AA 57 分 — teortaxesTex · 2026-07-27
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27