vLLM 弹性专家并行:MoE 部署可在流量中动态增减 GPU
PyTorch · x · 2026-09-26
PyTorch 官方宣布,vLLM 的 Elastic Expert Parallelism 允许在活跃的 Mixture-of-Experts 推理部署中、于真实流量下动态添加或移除 GPU,对服务的中断和停机时间降到最低。
NVIDIA 的 Itay Alroy 将在 PyTorch Conference North America 2026 上演讲该主题,内容涵盖架构设计、关键实现细节、开放挑战与路线图,并讲解 EP 规模变化时会发生什么,以及 NIXL EP 如何支撑流量中的扩缩容。
「Infra」频道最新
- Anthropic 与 OpenAI 标价相同但缓存读取价差 4 倍,价目表不等于真实价格 — julsimon · 2026-09-26
- ASML 财报:EMMEA 销售占比从 4.7% 跌至零,欧洲在建 2015 年制程芯片 — julsimon · 2026-09-26
- Glamsterdam 升级将用状态快照取代修复阶段,节点同步再提速 — banteg · 2026-09-26
- 20 万卡 GB300 集群只有 10% MFU?社区热议 xAI 算力效率 — teortaxesTex · 2026-09-26
- 英伟达市值 5.4 万亿美元,超过英法德任一国股市总市值 — iamfakhrealam · 2026-09-26
- SemiAnalysis 拆解 DeepSeek V4.1 Flash:Engram 查表换 1.6 倍性价比 — teortaxesTex · 2026-09-26