GLM-5.2 API 调优到峰值 280 tokens/s

baseten · x · 2026-07-27

这条转发说,团队在 Kimi K3 发布前,刚把 GLM-5.2 的性能优化工作收尾。

配文文章称,他们为 GLM-5.2 做出了当时最快的 API,关键数据是:

它强调的重点不是模型本身,而是把模型高效服务出来所需的推理与 API 工程能力。

所属事件:Baseten将GLM-5.2提速至280 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →