Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量

zhyncs42 · x · 2026-09-12

Together AI 团队引用 OpenRouter 数据称,其为 GLM 5.3 与 GLM 5.3 Flash 提供的推理服务在吞吐(TPS)、延迟与缓存命中率上均处头部水平,分别承载 OpenRouter 上两款模型 23% 和 30% 的流量,而 OpenRouter 仅占其整体 API 流量的一小部分。团队强调规模化 agent 推理不能只优化单一指标,需要在吞吐、延迟、缓存、可靠性等多维度同时优化。OpenRouter 页面显示 GLM 5.3 是 Z.ai 面向复杂软件工程与长程 agent 任务的大型推理模型,支持 1M token 上下文,定价 $0.8727/$3.36 每百万 token(输入/输出),推理默认开启。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →