专题 · FULL STORY
Baseten推出GLM-5.2 Fast API提速
推理平台Baseten于7月下旬针对GLM-5.2模型推出全新的Fast API档位。通过持续优化,该服务吞吐量大幅提升至初期的两倍以上,峰值达280 tokens/s,进一步满足了高并发实时场景的需求。
2026-07-24 ~ 2026-07-27 · 2 集 · 9 条
第 1 集 · Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍(2026-07-24,6 条)
7月24日,推理平台Baseten正式推出GLM-5.2 Fast模型API,这是一个面向高要求实时场景的新档位。官方称,该Fast档位的吞吐量(TPS)比标准GLM-5.2 Model API高出2-3倍,在处理高并发请求时能保持稳定的极速体验。目前该API已上线并开放给用户试用。
已确认
Baseten官方确认,GLM-5.2 Fast档位专为最严苛的实时应用场景设计,相比标准版GLM-5.2 MAPI能提供2到3倍的TPS提升。此外,已有开发者开始将该API接入`opencode`等实际工作流中进行使用。
为什么重要
此次推出Fast档位本质上是模型服务与推理基础设施层面的一次性能升级。对于需要处理大量实时交互任务的开发者和企业而言,该API能够显著降低响应延迟,提升系统的整体并发处理能力。
- Baseten 推出 GLM-5.2 Fast,实时场景吞吐提速 2-3 倍 — baseten · 2026-07-24
- Baseten 推出 GLM-5.2 Fast,实时场景 TPS 提升 2-3 倍 — baseten · 2026-07-24
- Baseten 推出 GLM-5.2 Fast API,吞吐提升 2 到 3 倍 — baseten · 2026-07-24
- Baseten 推出 GLM-5.2 Fast API,TPS 提升 2 到 3 倍 — baseten · 2026-07-24
- Baseten 上线 GLM-5.2 Fast 模型 API,主打极速并发处理 — baseten · 2026-07-24
- Baseten 称 GLM-5.2 Fast 实时吞吐提升 2 到 3 倍 — baseten · 2026-07-24
第 2 集 · Baseten将GLM-5.2提速至280 tok/s(2026-07-26,3 条)
Baseten 宣布将 GLM-5.2 的推理服务优化到发布初期两倍以上,API 峰值达 280 tokens/s、平均约 100 tokens/s,并推出面向 coding 和 agent 场景的低延迟 Fast 版本。团队称这使其成为当时最快的 GLM-5.2 API 实现。
- Baseten 将 GLM-5.2 API 性能翻倍,并推出低延迟 Fast 版本 — philipkiely · 2026-07-26
- GLM-5.2 API 调优到峰值 280 tokens/s — baseten · 2026-07-27
- Baseten 为 GLM-5.2 做出峰值 280 tok/s API — iamrobotbear · 2026-07-27