SGLang 联合 Google 与 RadixArk,为大模型提供原生 TPU 推理支持
ying11231 · x · 2026-07-31
开源 LLM 推理框架 SGLang 宣布与 Google Cloud 以及 RadixArk 展开合作,共同优化大语言模型和扩散模型在 TPU 上的推理体验。
目前,基于 JAX 开发的 SGL-JAX 已达到生产级标准,能够为 Gemma、Qwen、DeepSeek 等主流模型提供快速的原生 TPU 推理。此次合作将使 TPU 全面解锁 SGLang 的生产级特性,包括 5D 并行、Radix Cache、量化以及推测解码等。此外,团队还在推进 SGL-torchtpu,旨在为 PyTorch 用户提供原生的 TPU 推理路径。
所属事件:SGLang联手Google Cloud全面支持TPU推理(3 条相关)→
「Infra」频道最新
- SGLang登陆Google TPU:实现多款主流大模型无缝迁移 — BanghuaZ · 2026-07-31
- RTX 5090本地跑GLM-5.2与Kimi K3:速度可达129 tok/s — markjeffrey · 2026-07-31
- AI推理需求远超预期:Google Token消耗两年暴增330倍 — Beth_Kindig · 2026-07-31
- 投资人:没有加密货币的基建铺垫,就没有当前的AI热潮 — davidyin44 · 2026-07-31
- 曝OpenAI推理算力达2-3GW,远超中国开源 — zephyr_z9 · 2026-07-31
- AMD异构方案跑DeepSeek V4:速度达Nvidia DGX 3.6倍 — sandropuppo · 2026-07-31