月之暗面开源 FlashKDA,称 H20 预填充提速最高 2.22 倍
ctjlewis · x · 2026-07-27
月之暗面开源了 FlashKDA,这是一个基于 CUTLASS 的高性能 Kimi Delta Attention 内核实现。
- 它可以作为 flash-linear-attention 的直接替换后端使用。
- 官方给出的结果显示,在 H20 上相较于 flash-linear-attention 基线,prefill 速度提升 1.72×–2.22×。
- 仓库说明里的环境要求包括 SM90+、CUDA 12.9+ 和 PyTorch 2.4+。
「Infra」频道最新
- Cloudflare CTO 入选 TIME 年度高管:为 agent 时代重建互联网 — dinasaur_404 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23