GLM-5.3-Flash 实测:4机DGX跑出45 tok/s吞吐

AccBalanced · x · 2026-09-01

技术专家 Alex Ellis 公开了在 4 台 NVIDIA DGX Spark 上运行 GLM-5.3-Flash (NVFP4) 的完整配方。通过无交换机 RoCE 环网和 DFlash2 推测性起草器,实现了张量并行(TP4)部署,在 262K 上下文窗口下,真实 Agent 流量实测吞吐约 45 tok/s。该方案完全基于自有硬件,不依赖私有网关,且架构通用,已验证支持 GLM-5.2 和 DeepSeek-V4-Flash。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →