PyTorchCon 全程聚焦 vLLM:KV cache、分离式推理与专家并行

PyTorch · x · 2026-09-30

vLLM 项目将在 PyTorchCon North America 上大量露面:Simon Mo keynote 讲「Scaling Open Frontier Inference Infrastructure」,涉及 vLLM 核心架构改进、KV cache 管理与 GPU kernel 优化;技术分会覆盖 attention、KV cache 传输、disaggregated serving、弹性专家并行、跨硬件扩展(无需 fork)、自定义加速器/Trainium/RDMA KV 等;还有 vLLM 开发者见面会与海报环节。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →