GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s
teortaxesTex · x · 2026-08-27
用户分享 GLM 5.3 Flash 的实测性能数据,在 2 张 DGX Station (TP=2) 配置下,未经调优即可达到 C=64 时 881 tok/s、C=1 时 232 tok/s 的推理速度。该模型支持长上下文,单机可 realistically 服务 4-8 个并发用户,并且支持视觉能力。评论指出这体现了优化 kernel 和 prediction heads 仍有巨大潜力。
「Infra」频道最新
- 观点:HF 被 NVIDIA 收购后或丧失硬件中立性 — QuixiAI · 2026-08-27
- 英伟达手握算力分配权:AI 公司成败皆由它裁决 — matt_slotnick · 2026-08-27
- 英伟达财报炸裂,分析师称这是历史性觉醒时刻 — PTrubey · 2026-08-27
- 担心 HuggingFace 变天?用 BT 下载与备份 AI 模型指南 — SeyAssociation38 · 2026-08-27
- 两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文 — SeanHighness · 2026-08-27
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27