vLLM 宣布 TPU 成为一级后端
vllm_project · x · 2026-08-27
vLLM 项目通过与 Google Cloud 和 Anyscale 的合作活动,宣布了 TPU 后端的最新进展。新的 vLLM TPU 由 tpu-inference 驱动,统一了 JAX 和 PyTorch 的 lowering 路径。这使得开发者能够在 TPU 上运行 PyTorch 模型定义而无需修改代码,同时保持 vLLM 的标准化用户体验。目前推荐的 TPU 版本包括 v7x, v5e 和 v6e,并提供了详细的 Quickstart 指南和 Recipes。
「Infra」频道最新
- 预测:单台桌面机将能运行 k3 级模型 — AaronBergman18 · 2026-08-27
- Anthropic 拟斥资 450 亿美元锁定 460MW 算力,GPU 均价曝光 — zephyr_z9 · 2026-08-27
- Kioxia 拟投资 1 万亿日元在岩手县建第三座晶圆厂 — zephyr_z9 · 2026-08-27
- DeepSeek-V4-Flash 推理提速至 51.5 tok/s — antirez · 2026-08-27
- Colibrì 引擎升级:支持 2.8T 参数模型,显存吞吐暴增 — solyarisoftware · 2026-08-27
- 黄仁勋:500 亿美元数据中心投资回本周期不到一年 — zephyr_z9 · 2026-08-27