Baseten 将 GLM-5.2 API 性能翻倍,并推出低延迟 Fast 版本
philipkiely · x · 2026-07-26
Baseten 介绍了他们为 GLM-5.2 做的推理服务优化:相较发布初期,API 性能已经提升到 2 倍以上,并且专门做了一版面向 coding 和 agent 场景的 GLM-5.2-Fast API。
文中列出的主要优化包括:
- 调整 scheduler、修复推理栈中的性能/质量 bug
- 更新 NVFP4 权重
- 改进 speculative decoding 配置
- 为 fast API 采用更偏低延迟的并行与 batch 策略
- 在 fast API 上减少 max batch size,并从 ADP 转向更偏延迟优化的张量/专家并行
这两套 API 都跑在 NVIDIA B200 GPU 上。为了换取更低延迟,fast API 的输入/输出 token 价格比通用版 高 50%。文章也提醒,真实性能会受流量形态、输入输出长度影响,后续还会继续优化 speculative decoding。
「Infra」频道最新
- Reddit 用户纠结 3000 美元 M1 Ultra 128GB 与 M2 Ultra 64GB — jaqueh · 2026-07-26
- MCP 成功不等于正确,谁来验证工具副作用成了问题 — marcin_michalak · 2026-07-26
- vLLM 和 Ray 能否把热专家挪到 RTX 5090 上 — 2thleZ · 2026-07-26
- 硬核探讨:跨设备异构组网下 vLLM 与 Ray 的混合部署 — jwhh91 · 2026-07-26
- AI 蒸馏撞上知识产权灰区,中国芯片自给已到 41% — Exponential View (Azeem Azhar) · 2026-07-26
- Agent 推理成本为何暴涨,多智能体把 Token 账单推高数倍 — 机器之心 · 2026-07-26