双 GB10 集群调优 GLM-5.3-Flash:32k 预填充提速 20%

EAccelerate_42 · x · 2026-09-26

作者在 ASUS GX10 + DGX Spark 双 GB10 双轨集群上对 MiaAI-Lab 的 GLM-5.3-Flash 做了调优,权重与输出质量不变:32k prefill 从 1,426 提到 1,700 tok/s(+20%),编码 decode 从 49 提到 58 tok/s(+19%),结构化 decode 从 73 提到 79 tok/s,128k prompt 达 1,697 tok/s。完整配置与实测细节见其开源仓库。

所属事件:双 GB10 集群调优 GLM-5.3-Flash:预填充提速 20%(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →