专题 · FULL STORY

Baseten推出GLM-5.2 Fast API提速

推理平台Baseten于7月下旬针对GLM-5.2模型推出全新的Fast API档位。通过持续优化,该服务吞吐量大幅提升至初期的两倍以上,峰值达280 tokens/s,进一步满足了高并发实时场景的需求。

2026-07-24 ~ 2026-07-27 · 2 集 · 9 条

第 1 集 · Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍(2026-07-24,6 条)

7月24日,推理平台Baseten正式推出GLM-5.2 Fast模型API,这是一个面向高要求实时场景的新档位。官方称,该Fast档位的吞吐量(TPS)比标准GLM-5.2 Model API高出2-3倍,在处理高并发请求时能保持稳定的极速体验。目前该API已上线并开放给用户试用。

已确认

Baseten官方确认,GLM-5.2 Fast档位专为最严苛的实时应用场景设计,相比标准版GLM-5.2 MAPI能提供2到3倍的TPS提升。此外,已有开发者开始将该API接入`opencode`等实际工作流中进行使用。

为什么重要

此次推出Fast档位本质上是模型服务与推理基础设施层面的一次性能升级。对于需要处理大量实时交互任务的开发者和企业而言,该API能够显著降低响应延迟,提升系统的整体并发处理能力。

第 2 集 · Baseten将GLM-5.2提速至280 tok/s(2026-07-26,3 条)

Baseten 宣布将 GLM-5.2 的推理服务优化到发布初期两倍以上,API 峰值达 280 tokens/s、平均约 100 tokens/s,并推出面向 coding 和 agent 场景的低延迟 Fast 版本。团队称这使其成为当时最快的 GLM-5.2 API 实现。