GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s

teortaxesTex · x · 2026-08-27

用户分享 GLM 5.3 Flash 的实测性能数据,在 2 张 DGX Station (TP=2) 配置下,未经调优即可达到 C=64 时 881 tok/s、C=1 时 232 tok/s 的推理速度。该模型支持长上下文,单机可 realistically 服务 4-8 个并发用户,并且支持视觉能力。评论指出这体现了优化 kernel 和 prediction heads 仍有巨大潜力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →