Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开
whiteh4cker · reddit · 2026-09-11
Reddit 用户 whiteh4cker 分享用 2×RTX 3090(Windows 11、192GB DDR5)在 llama.cpp 的 FlashNext 分支上本地运行 Qwen3.8 Flash Next UD-Q4KXL 的实测结果:生成速度从主分支的 20 t/s 提升到 49 t/s,提示处理约 140 t/s(提示处理主分支更快)。
帖子给出了完整的复现细节:
- 编译命令(CMake + Ninja + CUDA 13.3.1,开启 GGMLCUDA)
- 完整启动脚本:262K 上下文、bf16 KV cache、专家权重放 CUDAHost + per-layer embedding 放 CPU、moe-expert-cache 150
- 使用 draft-mtp + ngram-mod 双路投机解码(MTP 草稿模型 + n-gram 匹配 12–24)拉高生成速度
- 推理参数 temp 1.0 / top-p 0.95 / top-k 20,reasoningeffort 设为 xhigh
对想在本地跑最新 MoE 模型并压榨多卡速度的人,这是一份可直接照抄的配置。
「Infra」频道最新
- NVIDIA 开源 BioNeMo 推理运行时,GPU 加速蛋白质结构预测 — AllThingsApx · 2026-09-12
- NVIDIA BioNeMo 跑 3100 万次蛋白质复合物预测,省约 1.35 GWh 能源 — AllThingsApx · 2026-09-12
- Signal65 发布 PINNACLE 基准:按「正确完成的工作量」评测 agentic AI — ryanshrout · 2026-09-12
- DeepSeek 算力被预订一空,加码空间或只剩数据侧 — teortaxesTex · 2026-09-11
- Blackstone 重仓 AI 算力,联手 Google、Nvidia、Anthropic 下注 — abhiadesai · 2026-09-11
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11