单台 DGX Spark 跑 Qwen3.8 Flash NVFP4:1M 上下文实测方案

BLUECOW009 · x · 2026-09-04

Mia AI Lab 发布了一套在单台 DGX Spark(121 GiB 统一内存,TP=1)上通过 vLLM 部署 Qwen3.8-Flash-Next NVFP4(99 GB 权重)的完整配方,PLE 表离线并内存映射加载。

实测性能:

作者认为这是目前单台 DGX Spark 上最佳模型选择,优于 Qwen3.8-27B 和单机版 DeepSeek v4 Flash。仓库提供 start.sh/stop.sh 脚本,约 10-12 分钟完成启动,还写明了 /dev/shm 泄漏等踩坑规避。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →