双 3090 跑 Qwen3.8-Flash-Next:专家下放内存,51B n-gram 表落 NVMe
jbro1985 · reddit · 2026-08-29
Reddit 用户分享在 2×RTX 3090 + 96GB DDR5 上部署 Qwen3.8-Flash-Next(125B MoE + 51B n-gram 表)的完整实测:专家权重下放内存、n-gram 表经 mmap 放 NVMe。
Llama.cpp
- UD-Q4KXL 下 32 t/s 解码、463 t/s 预填(640K serving pool,4×160K 通道,q8 KV)
- 51B 表测得零跨 token 复用,常驻近乎归零,解码成本几乎为零——SSD 随机读是正确架构而非妥协
- --moe-cache 5000(PR #24528 分支)带来 +30% 解码提升,但并发会抵消收益;浅层并发、深层串行
- 暖会话前缀缓存每轮仅重处理约 24 token(含 DeltaNet 状态)
- 发现并修复 gridDim.y 溢出崩溃(与上游 PR #27941 同型,2 行修复)
- systemd cgroup 限内存 6G 后,90GB 下载期间仍稳住 32 t/s
vLLM
- 将未合并的 mmap-PLE PR (#54129) 移植到 qwen38-flash-next 镜像:W4A16、TP=2,表从 NVMe 读取;官方配方要求 ≥110GB 空闲内存,此方案 53GB 即可
- 真实表解码 15.3 t/s vs 桩表 16.0 t/s,NVMe n-gram 开销约 4%
- 必须用选择性 UVA offload:朴素 --cpu-offload-gb 每步全量重拷(2.5 t/s),改 routedexperts 参数路由后达 16 t/s
- PCIe 带宽是瓶颈时 MTP 投机解码反而变慢(13.9 vs 16.0)
「Infra」频道最新
- Scobleizer:Qwen Cloud 原生构建 AI,集成更优 — Scobleizer · 2026-08-29
- NVL72实测AgentX吞吐量能效比竞品高30倍 — nvidia · 2026-08-29
- a16z 合伙人:全美仅 2% 电工持有直流电认证 — GregCook2011 · 2026-08-29
- GPU 集群中最「无聊」的网络能救命:带外管理详解 — AccBalanced · 2026-08-29
- 实测 STM32 与 ESP32 运行通用机器人控制策略 — yacineMTB · 2026-08-29
- 隐私架构构建信任:用户愿向 AI 敞开心扉 — bgmshana · 2026-08-29