SGLang登陆Google TPU:实现多款主流大模型无缝迁移
BanghuaZ · x · 2026-07-31
Google Cloud 与 RadixArk 达成合作,将开源推理框架 SGLang 引入 TPU 平台。
- 当前支持:开发者可通过 SGL-JAX 在最新一代 TPU 上运行 SGLang,已支持 Gemma、Qwen、DeepSeek、Kimi、Grok 等主流大语言模型,以及 Wan、Flux 等扩散模型。
- 未来规划:今年晚些时候将推出 PyTorch 原生后端 SGL-torchtpu,支持全尺寸前沿模型的多主机运行,并提供数据/张量/专家/上下文等全方位并行能力。
- 生态目标:承诺实现新模型在 TPU 上的 Day 0 支持,使 TPU 成为高效且即插即用的前沿推理替代方案。
所属事件:SGLang联手Google Cloud全面支持TPU推理(3 条相关)→
「Infra」频道最新
- 单节点跑通 Inkling Small:500ms 内实现原生语音交互 — andimarafioti · 2026-07-31
- 大模型推理成本骤降:4个月Token价格缩水至十三分之一 — charliermarsh · 2026-07-31
- 三星财报:Agentic AI 带动企业级 SSD 需求激增 — davidyin44 · 2026-07-31
- vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑 — vllm_project · 2026-07-31
- 马来西亚居民抗议成功,逼停当地数据中心建设 — im_mansigupta · 2026-07-31
- Meta AI基础设施租赁义务三个月激增53%,总额近2790亿美元 — Polymarket · 2026-07-31