Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍

7月24日,推理平台Baseten正式推出GLM-5.2 Fast模型API,这是一个面向高要求实时场景的新档位。官方称,该Fast档位的吞吐量(TPS)比标准GLM-5.2 Model API高出2-3倍,在处理高并发请求时能保持稳定的极速体验。目前该API已上线并开放给用户试用。

已确认

Baseten官方确认,GLM-5.2 Fast档位专为最严苛的实时应用场景设计,相比标准版GLM-5.2 MAPI能提供2到3倍的TPS提升。此外,已有开发者开始将该API接入opencode等实际工作流中进行使用。

为什么重要

此次推出Fast档位本质上是模型服务与推理基础设施层面的一次性能升级。对于需要处理大量实时交互任务的开发者和企业而言,该API能够显著降低响应延迟,提升系统的整体并发处理能力。

2026-07-24 ~ 2026-07-24 · 6 条相关

事件全程(共 2 集)→

一手来源

另有 3 条近重复转述:baseten · baseten · baseten