GLM-5.3-Flash 实测:4机DGX跑出45 tok/s吞吐
AccBalanced · x · 2026-09-01
技术专家 Alex Ellis 公开了在 4 台 NVIDIA DGX Spark 上运行 GLM-5.3-Flash (NVFP4) 的完整配方。通过无交换机 RoCE 环网和 DFlash2 推测性起草器,实现了张量并行(TP4)部署,在 262K 上下文窗口下,真实 Agent 流量实测吞吐约 45 tok/s。该方案完全基于自有硬件,不依赖私有网关,且架构通用,已验证支持 GLM-5.2 和 DeepSeek-V4-Flash。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01