Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量
zhyncs42 · x · 2026-09-12
Together AI 团队引用 OpenRouter 数据称,其为 GLM 5.3 与 GLM 5.3 Flash 提供的推理服务在吞吐(TPS)、延迟与缓存命中率上均处头部水平,分别承载 OpenRouter 上两款模型 23% 和 30% 的流量,而 OpenRouter 仅占其整体 API 流量的一小部分。团队强调规模化 agent 推理不能只优化单一指标,需要在吞吐、延迟、缓存、可靠性等多维度同时优化。OpenRouter 页面显示 GLM 5.3 是 Z.ai 面向复杂软件工程与长程 agent 任务的大型推理模型,支持 1M token 上下文,定价 $0.8727/$3.36 每百万 token(输入/输出),推理默认开启。
「Infra」频道最新
- Zilliz CTO:Agent 记忆不是索引功能,而是长期运维的系统工程 — J_Luan_ · 2026-09-12
- Draw Things 新版上线:支持 MiniMax H3 与 Krea 2 模型 — antirez · 2026-09-12
- Wafer 推出号称最全的 AI 性能工程资源库,首篇拆解 Transformer 推理 — ycombinator · 2026-09-12
- 全球廉价电力争夺战:AI 数据中心该建在哪,训练与推理答案不同 — pravchaw · 2026-09-12
- 用股权融资买算力本末倒置,风投圈提议发明「硬件收入衍生品」 — ns123abc · 2026-09-12
- Relace 单日处理 1 万亿 token,占 DeepSeek v4 Flash 37% 流量 — stuffyokodraws · 2026-09-12