PyTorchCon NA puts vLLM center stage: KV cache, disaggregated serving, expert parallelism

PyTorch · x · 2026-09-30

vLLM features throughout PyTorchCon North America: Simon Mo keynotes on scaling open frontier inference infrastructure (core architecture, KV cache management, GPU kernels), with sessions on attention, KV cache transfer, disaggregated serving, elastic expert parallelism, cross-hardware scaling, custom accelerators, Trainium and RDMA KV, plus a dev meet-and-greet and posters.

Original post →

More from Infra

Infra channel →