FlashMLA 移植消费级 Blackwell,MLA 注意力实测最高快 3 倍

smashedshanky · reddit · 2026-08-30

开发者在做支持任意架构(GQA/MLA/Dense)的开源 LLM 训练库时,发现 DeepSeek 的 FlashMLA 内核只编译了数据中心级 sm100/sm90,于是为消费级 Blackwell sm120 移植构建了 Windows/Linux 版本并开源。

推理实测(对比 PyTorch SDPA):

训练实测(前向+反向):Dense 序列 1024/4096/8192 分别提速 3.29x / 2.40x / 3.04x,稀疏 prefill 3.01x。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →