GLM 上线后又开始试 8×H100 跑 DSv4 Flash
TheZachMueller · x · 2026-07-22
GLM 上线后,作者开始折腾 8×H100 部署 DSv4 Flash
原帖说,GLM 已经部署完成,而且速度“还不错”,接下来准备在 8 张 H100 上继续部署 DSv4 Flash,看看还能把速度榨到什么程度。
帖子还点出了准备尝试的并行与推理配置:DP4、EP8、TP2,以及 FP8 KV。这更像是一条关于 模型服务与推理栈调优 的实战记录,而不是模型本身的发布。
「Infra」频道最新
- FLUX.1-dev 转成 ConvRot 后峰值显存最多降 32.5% — ThaJedi · 2026-07-22
- 一人把实时体育赔率接成 MCP,防止 agent 瞎编盘口 — paperandbeyond23 · 2026-07-22
- 一组本地 AI 资源串起 ODS 与推理引擎入门 — mervenoyann · 2026-07-22
- 一篇看懂 AI 芯片背后的软件和代工链 — shashib · 2026-07-22
- 大厂 AI 扩建可能正变成资产负债表陷阱 — Smart_AI_Hustle · 2026-07-22
- AI 智能体会用加密钱包,还是只要更好的支付 API — Digitalpaver · 2026-07-22