4卡 DGX Spark 实测:GLM-5.2 推理飙至 44.6 tok/s

EAccelerate_42 · x · 2026-08-11

开发者分享了在 4 节点 NVIDIA DGX Spark (GB10) 集群上部署 GLM-5.2 的最优配置。他强调该配置并非为刷分而生,而是完全基于真实的智能体编码工作负载进行调优。

目前该集群实现了 44.6 tok/s 的单流解码速度,相比两天前的 5.7 tok/s 实现了大幅跨越。关键提升来自于社区此前一直忽视的一个环境变量设置,相关代码与调优细节已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →