vLLM 弹性专家并行:MoE 部署可在流量中动态增减 GPU

PyTorch · x · 2026-09-26

PyTorch 官方宣布,vLLM 的 Elastic Expert Parallelism 允许在活跃的 Mixture-of-Experts 推理部署中、于真实流量下动态添加或移除 GPU,对服务的中断和停机时间降到最低。

NVIDIA 的 Itay Alroy 将在 PyTorch Conference North America 2026 上演讲该主题,内容涵盖架构设计、关键实现细节、开放挑战与路线图,并讲解 EP 规模变化时会发生什么,以及 NIXL EP 如何支撑流量中的扩缩容。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →