vLLM 宣布 TPU 成为一级后端

vllm_project · x · 2026-08-27

vLLM 项目通过与 Google Cloud 和 Anyscale 的合作活动,宣布了 TPU 后端的最新进展。新的 vLLM TPU 由 tpu-inference 驱动,统一了 JAX 和 PyTorch 的 lowering 路径。这使得开发者能够在 TPU 上运行 PyTorch 模型定义而无需修改代码,同时保持 vLLM 的标准化用户体验。目前推荐的 TPU 版本包括 v7x, v5e 和 v6e,并提供了详细的 Quickstart 指南和 Recipes。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →