GLM 5.2本地跑分实测
gutard · reddit · 2026-07-14
一位用户在 MacBook Pro M5 48GB 上跑 GLM 5.2,使用 Flash MoE 后获得了本地推理实测数据。
- 预填充约 4.4k tokens,耗时 6分38秒,生成 501 tokens,速度约 2t/s
- 不做预填充时,400 tokens 输入、337 tokens 输出,耗时 3分17秒
- 另外也观察到 2.8t/s,但会随机器当前负载波动
他提到自己用的是 pipenetwork/GLM-5.2-MLX-mixed-36bit,模型体积约 332GB。接下来还想试试让它夜间规划任务、白天再用 Qwen 执行计划。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11