vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍

vllm_project · x · 2026-10-10

vLLM 线程第四部分介绍一项具体优化:自 Ampere 起 NVIDIA GPU 的全局内存访问不均匀,CUDA 13.4 起开发者可通过 locality domain 利用这一特性——HBM 被分区,分区内 SM 读取本地全局内存最快。vLLM 将 MoE 的 FC1/FC2 权重按列切分,用 Green Contexts 在各分区的 SM 上各启动一个 kernel,使每个 SM 只读本地 HBM;早期结果显示 MiniMax M3 的 MoE 层 decode 最高提速 1.2 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →