单卡 DGX Spark 运行 Qwen 3.8 MoE 实测方案
QuixiAI · x · 2026-08-29
Shantanu Goel 分享了在单张 NVIDIA DGX Spark (128GB 显存) 上运行 Qwen3.8-Flash-Next (135GB MoE 模型) 的实践方案。通过使用 NVFP4、MTP 推测解码和 CUDA graphs,配合 torch.fromfile 将 PLE 表映射到 NVMe 以解决显存不足问题,同时修改 SGLang 内核限制以适配 GB10 架构。作者测试了实际任务配置而非极限数据,并计划进行更多基准测试。
「Infra」频道最新
- 高通 AI200 芯片被曝“只谈功耗不谈性能”引群嘲 — examachine · 2026-08-29
- 拆解 LLM Prefill 与 Decode 分离:硬件不同结果迥异 — vllm_project · 2026-08-29
- 升级推理引擎获 43% 提速,架构实现是关键 — colinmcnamara · 2026-08-29
- 开发者争论 CUDA 与 JIT DSL 的权衡与陷阱 — YouJiacheng · 2026-08-29
- Microsoft Fabric 变量库详解:消除硬编码与配置管理痛点 — adnan_hashmi · 2026-08-29
- Ollama 推出 Claude 集成,支持桌面版运行本地模型 — dr_cintas · 2026-08-29