GLM-5.3-EX3 本地实测:98% 接受率、175 tok/s 生成
HankYeomans · x · 2026-10-02
用户分享本地部署数据:在两张 RTX 6k Pro 显卡上运行 GLM-5.3-EX3(推测性解码配置下),草稿接受率达到 98%,生成速度 175 tok/s,prompt 吞吐约 4100 tok/s。作者自己也觉得这组数字好得有些不真实。
所属事件:网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s(2 条相关)→
「Infra」频道最新
- MachGen 让 MiniMax H3 突破 15 秒上限,实现 30 秒连续视频 — MiniMax_AI · 2026-10-02
- 网友用两台 DGX Spark 加 5090 搭出全本地 LLM 电台 — jwhh91 · 2026-10-02
- 投资人吐槽:多数 neocloud 可靠性只有“九个五”,远不到五个九 — saranormous · 2026-10-02
- 传贷方要求 NVIDIA 芯片贷款需 25% 抵押,算力融资链现裂缝 — GaryMarcus · 2026-10-02
- 微软携 Snowflake 推商业指标标准化,助 AI 工具读懂企业数据 — xiaosun86 · 2026-10-02
- GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升 — TheZachMueller · 2026-10-02