Prime Flash MoE 发布:专为 Blackwell 优化的 MoE 推理 CUDA 内核
sloppenheimer · x · 2026-08-14
PrimeIntellect 推出了 Prime Flash MoE,这是一套专为英伟达 Blackwell 架构优化的 MoE(混合专家模型)推理 CUDA 内核。
核心优化与性能:
- 通过避免中间张量的实体化,并在融合配置下避免激活值的实体化,大幅节省了显存带宽。
- 相比 PyTorch 的分组 GEMM,速度提升最高达 2.4 倍;在 4k-128k token 范围内实现约 2.3 倍的加速。
- 已集成至 prime-rl 框架中,用于加速 MoE 模型的前向传播。
双数据路径设计:
- 支持 BF16 和 MXFP8 两种数据格式,共享相同结构,区别在于如何向 Tensor Core 喂数据。
- 提供融合与拆分两种流水线。在小规模问题时,融合路径能减少激活值的往返;随着工作集增大,拆分路径通过实体化更小的激活值反而变得更具成本效益。
「Infra」频道最新
- Kimi-K3 解码提速 4 倍:Red Hat 推出 DSpark 推测解码器 — woosuk_k · 2026-08-14
- W&B 创立 9 年达成 10 亿次 AI 训练记录 — morgymcg · 2026-08-14
- 英伟达联手金融巨头募资超 5000 亿美元,将 AI 算力打造成新型资产类别 — sanjaykalra · 2026-08-14
- NVIDIA 新架构:让模型路由成为 AI 智能体的预算管家 — krishnan · 2026-08-14
- 英伟达联手华尔街拟撬动五千亿美元,算力资产化是创新还是泡沫? — whurley · 2026-08-14
- RTX 5060 Ti 跑 MiniMax H3 实测:分辨率是最大瓶颈 — danielcar · 2026-08-14