双 DGX Spark 跑 Qwen3.8-Flash-Next:解码 50t/s、预填充 2900t/s
-dysangel- · reddit · 2026-08-30
Reddit 用户 -dysangel- 分享在 2× NVIDIA DGX Spark(GB10) 上以 NVFP4 量化跑 Qwen3.8-Flash-Next 的完整配置,实测 TP2 下解码 49.7 t/s(结构化输出)/ 34.8 t/s(散文),11k tokens 预填充约 2,875 t/s,单机约 35 t/s。
技术栈要点:
- vLLM PR #53896 的 release/qwen38next 分支(主分支无此模型),外加 2 文件 sm121 补丁:CMakeLists 加 12.1 架构 + 约 90 行软件 E2M1 转换(GB10 无硬件 cvt 指令)
- PLE n-gram 表(48GB)从内置 NVMe 经 mmap 服务,MADVRANDOM 带来 30× 读放大差异;CPU worker 经 ZMQ + pinned buffer + CUDA-IPC 做 gather
- eager + MTP k=3,原生 venv 而非 Docker
踩坑清单(dead ends):
- PIECEWISE cudagraphs 在 MTP+TP2 下损失约 28% 解码速度(36 vs 50 t/s);单机无 MTP 时 graphs 有 +80% 增益
- Docker 默认容器无 IB 设备会静默降级 NCCL 到 TCP socket,预填充只有原生约 40%,需 --privileged 或设备直通
- RoCE 设备名跨重启不稳定、同型号机器间也可能不同,硬编码 NCCLIBHCA 会静默失败,需用 ibdev2netdev 动态枚举并以 NCCLDEBUG=INFO 验证
- flashinfer 必须用 0.6.18,0.6.17 会崩 NVFP4 MoE 回退内核
- vLLM 的 shuffleInputRowsKernel 有未初始化置换越界读,表现为假 CUTLASS GEMM 失败,两行边界防护已修
作者认为剩余优化方向是 block-diffusion drafting(DFlash/DSpark)与将解码分离到大带宽 Mac;MTP 接受率结构化输出约 3.8 token/step,散文明显更低,建议两种负载都跑分。
所属事件:双节点 DGX Spark 实测 Qwen3.8 达 181 tok/s 聚合吞吐(2 条相关)→
「Infra」频道最新
- AI 将彻底重塑芯片设计经济逻辑 — ai · 2026-08-30
- 英伟达业绩连创纪录股价却横盘半年,估值争议再起 — thedealdirector · 2026-08-30
- 苹果Mac业务增29%,OpenAI等抢购Mac Mini做AI算力 — Hesamation · 2026-08-30
- TrustScoreAgent:给 Agent 的服务信誉注册表 — TrustScoreAgent · 2026-08-30
- LongCat-Flash-Lite-Sparse 等多模型发布,支持百万上下文与稀疏注意力 — LLMFan46 · 2026-08-30
- TensorSharp 集成 MiniMax H3,实现本地图生视频推理 — fuzhongkai · 2026-08-30