Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s

NVIDIAAI · x · 2026-09-01

在 2 台 DGX Spark 上使用 NVFP4 格式运行 Qwen3.8 Flash Next,测试了 64 个并发用户。在 78.82 秒内生成了 32,768 个输出 token,吞吐量达到 415.7 tok/s。测试显示 64K/user 的可用上下文通过且零泄露,但这属于压力测试而非生产环境配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →