Baseten将GLM-5.2提速至280 tok/s
Baseten 宣布将 GLM-5.2 的推理服务优化到发布初期两倍以上,API 峰值达 280 tokens/s、平均约 100 tokens/s,并推出面向 coding 和 agent 场景的低延迟 Fast 版本。团队称这使其成为当时最快的 GLM-5.2 API 实现。
2026-07-26 ~ 2026-07-27 · 3 条相关
- 第 1 集:Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍(2026-07-24,6 条)
- 第 2 集:Baseten将GLM-5.2提速至280 tok/s(2026-07-26,3 条)
- Baseten 将 GLM-5.2 API 性能翻倍,并推出低延迟 Fast 版本 — philipkiely · 2026-07-26
- GLM-5.2 API 调优到峰值 280 tokens/s — baseten · 2026-07-27
- Baseten 为 GLM-5.2 做出峰值 280 tok/s API — iamrobotbear · 2026-07-27