GLM-5.3-Flash 本地部署实测:206 tok/s 与 1M 上下文

funding__secured · reddit · 2026-08-27

作者在 DGX Station GB300 上成功部署并测试了 GLM-5.3-Flash 模型。

性能数据:

部署配置 (Docker):

提供了完整的 docker run 命令,包含关键参数优化:

注意事项:

当前镜像存在 Bug,无法自动下载模型,需预先下载权重到本地并通过 --model 指向本地路径。

所属事件:GLM-5.3 Flash 多方实测:性能近 GPT-5.6、成本极低(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →