PyTorch 推出 TorchTPU,vLLM 与 SGLang 可原生跑 TPU
PyTorch · x · 2026-10-02
PyTorch 官方宣布基于全新 PyTorch 原生 TPU 后端 TorchTPU 构建的 vLLM 与 SGLang 推理引擎,并将在 PyTorch Conference 北美站(圣何塞)由 Google 的 Qi Zhou、Meta 的 Colin Taylor 与 Angela Yi 详细讲解。
技术要点:
- 目标是让现有 SGLang 和 vLLM 基础设施原生运行在 TPU 上,保留 GPU 用户已熟悉的调度器、批处理系统、OpenAI 兼容 API 和 torch.compile 工作流
- 服务引擎保持在上游主线,新模型和新功能无需单独的 TPU 专属实现即可在 TPU 上运行
- 演讲还将分享生产环境实测经验:编译时间、tracing 下的设备放置、KV cache 布局、跨芯片集合通信等
所属事件:PyTorch 发布原生 TPU 后端 TorchTPU,vLLM 与 SGLang 可直接运行(2 条相关)→
「Infra」频道最新
- Modal Runtime 一次推出多节点集群、VM 沙箱与粘性会话 — graceisford · 2026-10-02
- RTX 5070 12GB 本地视频生成求助:ComfyUI 工作流与模型选择 — AirSea2062 · 2026-10-02
- Lightmatter CEO 谈光学互连:备用激光器+光交换绕开单点故障 — BenBajarin · 2026-10-02
- 营收仅 1/5 股价却跑赢 8 倍:Nebius 与 CoreWeave 的算力资本分化 — Beth_Kindig · 2026-10-02
- Domingos 力挺数据中心:与居民同价付费,反能拉低电价 — pmddomingos · 2026-10-02
- PyTorch 推出 TorchTPU,vLLM 和 SGLang 可原生跑在 TPU 上 — PyTorch · 2026-10-02