Baseten 称 GLM-5.2 Fast 实时吞吐提升 2 到 3 倍
baseten · x · 2026-07-24
Baseten 发布了面向实时场景的 GLM-5.2 Fast 托管模型 API,官方说法是它比标准版 GLM-5.2 MAPI 的 TPS 高 2-3 倍。转述里还提到,有开发者已经把它当作自己在 opencode 里的主力编码模型,并给出了相应的配置方式,说明这不只是模型本身,而是与推理托管和开发工作流相关的基础设施动态。
所属事件:Baseten推出GLM-5.2 Fast API,实时吞吐提升2-3倍(6 条相关)→
「编程与Agent」频道最新
- 别让 AI 自造成功标准:给它可验证目标才好用 — daniel_mac8 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11