单台 DGX Spark 跑 Qwen3.8 Flash NVFP4:1M 上下文实测方案
BLUECOW009 · x · 2026-09-04
Mia AI Lab 发布了一套在单台 DGX Spark(121 GiB 统一内存,TP=1)上通过 vLLM 部署 Qwen3.8-Flash-Next NVFP4(99 GB 权重)的完整配方,PLE 表离线并内存映射加载。
实测性能:
- 最高 1M 上下文,KV cache 达 1,431,164
- 支持文本、图像与视频的多模态输入
- 单流解码 37 tok/s,4 并发流最高 86 tok/s
- prefill 1500-2000 tok/s,通过 400k prefill 压力测试
作者认为这是目前单台 DGX Spark 上最佳模型选择,优于 Qwen3.8-27B 和单机版 DeepSeek v4 Flash。仓库提供 start.sh/stop.sh 脚本,约 10-12 分钟完成启动,还写明了 /dev/shm 泄漏等踩坑规避。
「Infra」频道最新
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 开源桌面工作台 Vyact:本地模型+文档 RAG+浏览器上下文一站集成 — vyact · 2026-09-04
- KV 量化在多深上下文开始劣化?F16 vs Q8/Q4 序列对齐 PoC — Slight_Analysis_5414 · 2026-09-04
- KV 缓存:自回归 LLM 推理的根基性优化,用内存换算力 — alec_helbling · 2026-09-04
- WSJ:数据中心让路易斯安那小县居民「集体中彩票」 — robleclerc · 2026-09-04
- 无编排器无 MCP:4 个对等 Agent 通过 gossip 组网完成真实调研任务 — Trainer_Intelligent · 2026-09-04