双 DGX Spark 跑通 Qwen3.8-Flash-Next

NVIDIAAI · x · 2026-08-27

MiaAI Lab 展示了在两张 NVIDIA DGX Spark 上运行 Qwen3.8-Flash-Next-NVFP4 的完整方案。该方案支持 90 万上下文与视觉能力,使用 SGLang 框架和 NVFP4 量化。实测单流约 64 tok/s,2-4 并发会话约 115 tok/s。项目提供了自动化脚本,涵盖权重下载、内核补丁构建及集群启动。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →