开发者优化 MoE 内核:BF16 提速 1.2 倍,MXFP8 提速 1.6 倍
retr0jirachi · x · 2026-09-05
开发者在 Prime Intellect 的 Prime Flash MoE 基础上数周优化,推出 Prime Super Flash MoE,目标是逼近硬件 roofline。
- 在 B200 上、4K–128K token 范围内,BF16 较上游快约 1.2 倍,MXFP8 快约 1.6 倍
- 针对 NVIDIA Blackwell tcgen05 编写的融合 MoE 前向内核:gate/up 投影、SwiGLU 激活、down 投影与 top-k 加权归约全部融合,2H 宽的 gate/up 张量完全不用落盘,直接从累加器消费
- 提供 split=False(单次 kernel launch 完成整个 FFN,中间激活不出 SM)等两条流水线,并新增持久化 BF16/MXFP8 worker、并行路由对齐路径与更快的 epilogue
代码与优化报告已开源,报告含完整方法论、采纳与放弃的实验及机器可读证据。
「Infra」频道最新
- AMD 携手 Cisco 与沙特 HUMAIN 部署 MI335X 集群,规划 250MW — Beth_Kindig · 2026-09-05
- Reef 发布推理原生基础设施:自改进 Agent 边学习边不间断服务 — pliang279 · 2026-09-05
- 从 1D 到 2D int8 量化 GPU kernel,博主分享底层性能跃升 — goyal__pramod · 2026-09-05
- Google DeepMind 推出免费在线书《How To Scale Your Model》讲透 TPU 上 LLM 扩展 — goyal__pramod · 2026-09-05
- 显卡能跑多少 token/s?一条显存带宽公式帮你估算上限 — Pyrolistical · 2026-09-05
- Google Cloud 用 Cloud Run 沙箱破解编码 agent「修复循环」难题 — rseroter · 2026-09-05