GLM 5.3 Flash 实测:未调优即获 881 tok/s
HankYeomans · x · 2026-08-27
Alex Ellis 转引的实测数据显示,GLM 5.3 Flash 模型在未微调状态下,于 2x DGX Station (TP=2) 上实现了 881 tokens/s 的吞吐量(C=64),单并发下为 232 tok/s。长文本场景下可支持 4-8 个并发用户,且支持视觉能力。
所属事件:GLM-5.3 Flash 实测:性能对标 GPT-5.6 级且成本极低(5 条相关)→
「模型」频道最新
- 「便宜中国模型威胁前沿实验室」是劳动力固化谬误?引争论 — robleclerc · 2026-08-27
- 安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征 — DavidSKrueger · 2026-08-27
- 让模型更保守竟导致误判率上升?Prompt 工程陷阱 — CupGlass540 · 2026-08-27
- 口述转 Claude 格式化,产出仍被判 100% AI — threepointone · 2026-08-27
- 实测称 Opus 5 Max 耗 token 三倍于 Medium 收益甚微 — abeirami · 2026-08-27
- Mollick 警告:别把人格投射进 METR 报告的 agent — emollick · 2026-08-27