GLM 5.3 Flash 实测:未调优即获 881 tok/s

HankYeomans · x · 2026-08-27

Alex Ellis 转引的实测数据显示,GLM 5.3 Flash 模型在未微调状态下,于 2x DGX Station (TP=2) 上实现了 881 tokens/s 的吞吐量(C=64),单并发下为 232 tok/s。长文本场景下可支持 4-8 个并发用户,且支持视觉能力。

所属事件:GLM-5.3 Flash 实测:性能对标 GPT-5.6 级且成本极低(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →