FlashMLA 移植消费级 Blackwell,MLA 注意力实测最高快 3 倍
smashedshanky · reddit · 2026-08-30
开发者在做支持任意架构(GQA/MLA/Dense)的开源 LLM 训练库时,发现 DeepSeek 的 FlashMLA 内核只编译了数据中心级 sm100/sm90,于是为消费级 Blackwell sm120 移植构建了 Windows/Linux 版本并开源。
推理实测(对比 PyTorch SDPA):
- 稀疏 fp8 decode(b=128, topk=2048):2.62x 提速;稀疏 serving 场景约 5x
- 稀疏 prefill(sq=512, skv=8192):2.61x
- FP8 KV cache:延迟 -8%,缓存内存省 1.84x(SDPA 反而 +1.8%)
- bf16 缓存的模型级 decode 约持平
训练实测(前向+反向):Dense 序列 1024/4096/8192 分别提速 3.29x / 2.40x / 3.04x,稀疏 prefill 3.01x。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01