PyTorchCon 将展示 MoRI+vLLM:AMD GPU 上跨 pod MoE 推理
PyTorch · x · 2026-10-11
在 PyTorch Conference North America 2026 上,AMD 的三位工程师将展示「MoRI + vLLM」:面向 AMD Instinct GPU 的 disaggregated MoE 服务方案。
- 跨 pod 运行大型 MoE 模型有两大挑战:专家 dispatch/combine 通信量,以及 prefill 与 decode 之间迁移 KV cache。
- 方案把 MoRI 通信栈引入 vLLM,用 RDMA 实现跨 pod 的 Wide Expert Parallelism,并在分离式 prefill/decode 间传输 KV cache。
- 演讲还将分享跨 pod 时的正确性与稳定性问题,以及长上下文、高并发负载下的 vLLM 基准结果。
「Infra」频道最新
- 曝 DeepSeek v4.1 长上下文提速:32K prefill 吞吐提升约 40% — HankYeomans · 2026-10-11
- 先进封装推高缺陷成本,晶圆级老化测试成 GPU 时代新刚需 — BenBajarin · 2026-10-11
- 光学测试成 CPO 规模部署最大瓶颈:探针与自动化难题解析 — BenBajarin · 2026-10-11
- Cboe 前总部将改建为 33MW 数据中心,租金远超普通写字楼 — deanwball · 2026-10-11
- 微软开源 bitnet.cpp:1-bit 推理框架可在 CPU 上跑 100B 模型 — HildeKuehne · 2026-10-11
- 高通 CEO:AI 公司要在 2028 年让手机常驻运行千亿参数模型 — zephyr_z9 · 2026-10-11