PyTorch 推出 TorchTPU,vLLM 和 SGLang 可原生跑在 TPU 上
PyTorch · x · 2026-10-02
PyTorch 官方宣布基于新的 PyTorch 原生 TPU 后端 TorchTPU,vLLM 和 SGLang 推理引擎已在 TPU 上原生运行。Google 的 Qi Zhou 与 Meta 的 Colin Taylor、Angela Yi 将在圣何塞 PyTorch Conference North America 上分享细节。
- 核心思路是让现有 serving 基础设施原生于 TPU:保留调度器、批处理系统、OpenAI 兼容 API 和 GPU 用户熟悉的 torch.compile 工作流。
- 由于 serving 引擎保持在 upstream,新模型和新功能无需单独写 TPU 专用实现即可直接跑在 TPU 上。
- 演讲还将覆盖生产环境经验:编译时间、tracing 下的设备放置、KV cache 布局与跨芯片集合通信。
所属事件:PyTorch 发布原生 TPU 后端 TorchTPU,vLLM 与 SGLang 可直接运行(2 条相关)→
「Infra」频道最新
- Benchmark领投芯片初创Tendrils Compute,估值或超10亿美元 — Sethwinterroth · 2026-10-02
- Modal Runtime 一次推出多节点集群、VM 沙箱与粘性会话 — graceisford · 2026-10-02
- RTX 5070 12GB 本地视频生成求助:ComfyUI 工作流与模型选择 — AirSea2062 · 2026-10-02
- 营收仅 1/5 股价却跑赢 8 倍:Nebius 与 CoreWeave 的算力资本分化 — Beth_Kindig · 2026-10-02
- Domingos 力挺数据中心:与居民同价付费,反能拉低电价 — pmddomingos · 2026-10-02
- 马斯克:SpaceX 版 VR72 有望跑出近 250kW 平均功率 — McDonaghMatthew · 2026-10-02