vLLM 实测:4:8 稀疏专家 GEMM 比 NVFP4 密集快 1.35-1.65 倍
vllm_project · x · 2026-10-07
vLLM 官方转发 @jbish1572 对 paired 4:8 稀疏化的实测数据:该模式是每 8 个权重中保留两组相邻配对(2 个相邻 pair)。实测显示 expert GEMM 在 B200 上比密集 NVFP4 快 1.35-1.65 倍,但理论上的 2 倍峰值收益在实际 serving 中无法保持——Kimi-K2.5 在 vLLM 服务中实测加速为 1.18 倍。这为 MoE 模型的稀疏推理收益提供了贴近真实的基准参考。
「Infra」频道最新
- 英伟达市值逼近 6 万亿美元,官宣史上最大 1500 亿回购 — rohanpaul_ai · 2026-10-07
- 每台电机 7 分钟人工、约 5 美元成本,机器人自动化成唯一出路 — avlok · 2026-10-07
- 铁路建设曾持续占 GDP 1.5-2% 达 60 年,AI 算力扩张今年才追平 — toptickcrypto · 2026-10-07
- 同款 RTX 5090 推理差百倍:vLLM 官方证实引擎比硬件更关键 — vllm_project · 2026-10-07
- kipply 发布七八月双月报:出口管制解除、对齐造假信号等大事复盘 — kipperrii · 2026-10-07
- Marvell 投资者日 2026 材料上线,数据中心 AI 算力布局受关注 — jwt0625 · 2026-10-07