Prime Flash MoE:Blackwell优化CUDA内核,MoE推理提速2.4倍
pbaylies · x · 2026-08-14
Prime Intellect 发布 Prime Flash MoE,一套针对 Blackwell 优化的 CUDA 内核,用于 MoE 推理。通过融合路由感知 GEMM、SwiGLU、量化和归约,避免中间张量在 HBM 中物化,节省内存流量。相比 PyTorch grouped GEMM 最高提速 2.4 倍,在 4k-128k token 范围平均提速约 2.3 倍。支持 BF16 和 MXFP8 数据路径,并提供融合和分离两种流水线。代码已开源。
所属事件:Prime Intellect 推出 Blackwell 优化 MoE 推理内核(3 条相关)→
「Infra」频道最新
- Qwen 3.8-Max 登陆 Modal:2.4T 参数、1M 上下文,配备 DFlash 投机解码 — AAAzzam · 2026-08-14
- Durable Objects 类比 serverless 函数:有状态的对象即服务 — andersonbcdefg · 2026-08-14
- IEA:AI 单任务能耗年降约 10 倍,数据中心用电仍涨 50% — import_jmr · 2026-08-14
- CPO标准化白皮书:FAU间距从250μm缩至127μm,DWDM路线图遭质疑 — jwt0625 · 2026-08-14
- 网友质疑 SanDisk 夸大 KV cache 市场规模:或按 BF/FP16 估算需减半 — zephyr_z9 · 2026-08-14
- AMAT 财报:增长指引模糊,等待 Intel 提供能见度 — BenBajarin · 2026-08-14