Prime Flash MoE:Blackwell优化CUDA内核,MoE推理提速2.4倍

pbaylies · x · 2026-08-14

Prime Intellect 发布 Prime Flash MoE,一套针对 Blackwell 优化的 CUDA 内核,用于 MoE 推理。通过融合路由感知 GEMM、SwiGLU、量化和归约,避免中间张量在 HBM 中物化,节省内存流量。相比 PyTorch grouped GEMM 最高提速 2.4 倍,在 4k-128k token 范围平均提速约 2.3 倍。支持 BF16 和 MXFP8 数据路径,并提供融合和分离两种流水线。代码已开源。

所属事件:Prime Intellect 推出 Blackwell 优化 MoE 推理内核(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →