Baseten 宣称 GLM-5.3-Flash 推理速度达 122+ TPS
baseten · x · 2026-08-28
Baseten 宣布其在 Artificial Analysis、OpenRouter 和 Hugging Face 上为 GLM-5.3-Flash 提供最快推理服务,速度超过 122 TPS。服务全美部署,默认开启零数据保留 (ZDR),并表示将持续优化以提升吞吐并降低延迟。
「Infra」频道最新
- 高通数据中心机遇显现,定制ARM CPU或成早期增长点 — BenBajarin · 2026-08-28
- API网关Merge月处理Token激增11倍,开发需求井喷 — shensi · 2026-08-28
- RTX 3090 实测 Qwen3.8-Flash:量化策略与性能调优 — crusaderky · 2026-08-28
- Gemini 1.5 Flash 推理速度实测或超 300 tok/s — Sentdex · 2026-08-28
- 论文解析 NVSHMEM:GPU 通信的系统级分析 — thoefler · 2026-08-28
- Inferact 发布 GLM-5.3 NVFP4 版本,显存占用降 38% — vllm_project · 2026-08-28