网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s
网友 HankYeomans 分享了本地部署疑似 GLM 模型(写作 GLM-5.3-EX3,型号名尚待证实)的实测数据:在两块 RTX 6000 Pro 显卡上,采用推测性解码配置后,生成速度达到 175 tok/s,草稿接受率高达 98%,prompt 吞吐亦表现良好。该数据展示了消费级工作站硬件自托管大模型的可能性,引发社区对模型真实身份与部署细节的关注。
2026-10-02 ~ 2026-10-02 · 2 条相关
- 网友称自托管 GLM 模型在双 RTX 6000 Pro 上跑出 175 tok/s、98% 草稿接受率 — HankYeomans · 2026-10-02
- GLM-5.3-EX3 本地实测:98% 接受率、175 tok/s 生成 — HankYeomans · 2026-10-02