GLM-5.2在8×B200上的部署经济学分析
qubridInc · reddit · 2026-07-08
Qubrid 团队基于 8×B200 节点发布 GLM-5.2(约 750B 总参/40B 激活 MoE,256 专家 top-8,DSA+MLA 注意力,1M 上下文,MIT 许可)的部署配置分析。关键结论:MoE 解码在中并发下为带宽受限而非算力受限,因此 B200 相比 H200 在同 FP8 精度下每美元性能仅约 1.2 倍(贴近 HBM 带宽比,而非 2.3 倍算力比);真正改变数字的杠杆是 NVFP4(权重字节减半,Hopper 无 FP4 张量核心)。推荐配置为 NVFP4 + 两组 TP=4 副本,相较 TP=8 可获约 2 倍吞吐。作者同时指出目前缺乏 GLM-5.2 在文档化 8×B200 配置下的完整并发扫描表。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11