Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍
7月24日,推理平台Baseten正式推出GLM-5.2 Fast模型API,这是一个面向高要求实时场景的新档位。官方称,该Fast档位的吞吐量(TPS)比标准GLM-5.2 Model API高出2-3倍,在处理高并发请求时能保持稳定的极速体验。目前该API已上线并开放给用户试用。
已确认
Baseten官方确认,GLM-5.2 Fast档位专为最严苛的实时应用场景设计,相比标准版GLM-5.2 MAPI能提供2到3倍的TPS提升。此外,已有开发者开始将该API接入opencode等实际工作流中进行使用。
为什么重要
此次推出Fast档位本质上是模型服务与推理基础设施层面的一次性能升级。对于需要处理大量实时交互任务的开发者和企业而言,该API能够显著降低响应延迟,提升系统的整体并发处理能力。
2026-07-24 ~ 2026-07-24 · 6 条相关
- 第 1 集:Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍(2026-07-24,6 条)
- 第 2 集:Baseten将GLM-5.2提速至280 tok/s(2026-07-26,3 条)
一手来源
- Baseten 推出 GLM-5.2 Fast,实时场景 TPS 提升 2-3 倍 — baseten ·
- Baseten 推出 GLM-5.2 Fast,实时场景吞吐提速 2-3 倍 — baseten ·
- 【源头】Baseten 推出 GLM-5.2 Fast,实时场景吞吐提速 2-3 倍 — baseten · 2026-07-24
- 【源头】Baseten 推出 GLM-5.2 Fast,实时场景 TPS 提升 2-3 倍 — baseten · 2026-07-24
- Baseten 上线 GLM-5.2 Fast 模型 API,主打极速并发处理 — baseten · 2026-07-24