单卡 DGX Spark 运行 Qwen 3.8 MoE 实测方案

QuixiAI · x · 2026-08-29

Shantanu Goel 分享了在单张 NVIDIA DGX Spark (128GB 显存) 上运行 Qwen3.8-Flash-Next (135GB MoE 模型) 的实践方案。通过使用 NVFP4、MTP 推测解码和 CUDA graphs,配合 torch.fromfile 将 PLE 表映射到 NVMe 以解决显存不足问题,同时修改 SGLang 内核限制以适配 GB10 架构。作者测试了实际任务配置而非极限数据,并计划进行更多基准测试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →