Nebius 推理速度登顶:GLM 模型输出达 290tok/s

Arindam_1729 · x · 2026-08-31

Artificial Analysis 的最新排名显示,Nebius 在 12 家提供商中位居第一,特别是在运行 GLM-5.3-Flash 模型时:输出速度约为每秒 290 个 token,端到端响应时间约为 9.1 秒。这表明选择模型只是工作的一半,推理栈的优化直接决定了用户的实际体验。

所属事件:GLM-5.3-Flash 借 Nebius 平台登顶推理速度榜(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →