实测 Qwen3.8 在双节点 DGX 上达 181 tok/s 吞吐

StartupTim · reddit · 2026-08-29

开发者在 2 节点 NVIDIA DGX Spark (GB10) 上成功部署 Qwen3.8-Flash-Next,通过一系列优化实现了 181 tok/s 的聚合吞吐量(约 9 个并发 Agent 会话),单流解码速度为 30-50 tok/s。

关键优化与配置:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →