Nebius 推理速度登顶:GLM 模型输出达 290tok/s
Arindam_1729 · x · 2026-08-31
Artificial Analysis 的最新排名显示,Nebius 在 12 家提供商中位居第一,特别是在运行 GLM-5.3-Flash 模型时:输出速度约为每秒 290 个 token,端到端响应时间约为 9.1 秒。这表明选择模型只是工作的一半,推理栈的优化直接决定了用户的实际体验。
所属事件:GLM-5.3-Flash 借 Nebius 平台登顶推理速度榜(2 条相关)→
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01