网友称自托管 GLM 模型在双 RTX 6000 Pro 上跑出 175 tok/s、98% 草稿接受率

HankYeomans · x · 2026-10-02

网友 HankYeomans 分享本地部署数据:疑似 GLM 模型(写作 GLM-5.3-EX3,型号名待证实)在两块 RTX 6000 Pro 上达到 175 tok/s,配合投机解码草稿接受率高达 98%。发帖人自己都觉得这个数字「ridiculous」。注意:该型号名称疑为笔误,数据未经证实。

所属事件:网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →