vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍
vllm_project · x · 2026-10-10
vLLM 线程第四部分介绍一项具体优化:自 Ampere 起 NVIDIA GPU 的全局内存访问不均匀,CUDA 13.4 起开发者可通过 locality domain 利用这一特性——HBM 被分区,分区内 SM 读取本地全局内存最快。vLLM 将 MoE 的 FC1/FC2 权重按列切分,用 Green Contexts 在各分区的 SM 上各启动一个 kernel,使每个 SM 只读本地 HBM;早期结果显示 MiniMax M3 的 MoE 层 decode 最高提速 1.2 倍。
「Infra」频道最新
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
- AMD 联手 ai& 办东京黑客松:4.5 小时用 Kimi、GLM、Qwen、MiniMax 搭建 — DavidBennett__ · 2026-10-10
- 芝加哥市中心将建 AI 数据中心,空置写字楼迎来新用途 — willcb · 2026-10-10
- 开源 sparkDash 2.0:私有化 GPU token 工厂的产能看板 — aigclink · 2026-10-10