PyTorchCon 全程聚焦 vLLM:KV cache、分离式推理与专家并行
PyTorch · x · 2026-09-30
vLLM 项目将在 PyTorchCon North America 上大量露面:Simon Mo keynote 讲「Scaling Open Frontier Inference Infrastructure」,涉及 vLLM 核心架构改进、KV cache 管理与 GPU kernel 优化;技术分会覆盖 attention、KV cache 传输、disaggregated serving、弹性专家并行、跨硬件扩展(无需 fork)、自定义加速器/Trainium/RDMA KV 等;还有 vLLM 开发者见面会与海报环节。
「Infra」频道最新
- 论文 LLM-42 登 SOSP 2026:验证式投机让 LLM 推理确定性几乎零开销 — tianyin_xu · 2026-09-30
- 印尼 AI 路线之争:有数据中心不等于有控制权 — AryHHAry · 2026-09-30
- 特斯拉获300亿美元授信,加码AI基础设施、Robotaxi与芯片制造 — Polymarket · 2026-09-30
- 马斯克:星舰将每年发射至少300GW AI算力,目标月球火星自生长城市 — XFreeze · 2026-09-30
- 黄仁勋:不再叫数据中心,现在是「超级智能工厂」 — TinfoilTricorn · 2026-09-30
- 马斯克:孟菲斯数据中心致当地「用工荒」,税收或翻倍 — XFreeze · 2026-09-30