网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s

网友 HankYeomans 分享了本地部署疑似 GLM 模型(写作 GLM-5.3-EX3,型号名尚待证实)的实测数据:在两块 RTX 6000 Pro 显卡上,采用推测性解码配置后,生成速度达到 175 tok/s,草稿接受率高达 98%,prompt 吞吐亦表现良好。该数据展示了消费级工作站硬件自托管大模型的可能性,引发社区对模型真实身份与部署细节的关注。

2026-10-02 ~ 2026-10-02 · 2 条相关