网友称自托管 GLM 模型在双 RTX 6000 Pro 上跑出 175 tok/s、98% 草稿接受率
HankYeomans · x · 2026-10-02
网友 HankYeomans 分享本地部署数据:疑似 GLM 模型(写作 GLM-5.3-EX3,型号名待证实)在两块 RTX 6000 Pro 上达到 175 tok/s,配合投机解码草稿接受率高达 98%。发帖人自己都觉得这个数字「ridiculous」。注意:该型号名称疑为笔误,数据未经证实。
所属事件:网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s(2 条相关)→
「Infra」频道最新
- Ben Lorica:AI 数据问题已转移,从找原料变为加工可用 — bigdata · 2026-10-02
- 加州男子被捕:涉走私超3亿美元AI服务器至中国 — Polymarket · 2026-10-02
- 投资人吐槽:投了钱还得求 GPU 厂给被投公司明年配额 — mattturck · 2026-10-02
- Fireworks 实测:数值精度错位可致 RL 训练奖励崩溃,MoE 更易踩坑 — sophiamyang · 2026-10-02
- Lambda 完成超 10 亿美元 GPU 债务融资,固定利率 6.78% — TheZachMueller · 2026-10-02
- 双 DGX Spark 集群对战 M5 Ultra Mac Studio 实测视频出炉 — AIFlow_ML · 2026-10-02