单张 RTX 3090 + 128GB 内存跑通 180B MoE:15.5 tok/s 生成实测配置
cezarducatti · reddit · 2026-09-05
一位开发者在 RTX 3090(24GB)+ 128GB DDR4 上运行 Qwen3.8-Flash-Next(UD-Q4KXL,约 180B 总参/5B 激活的 MoE),公开完整 llama.cpp 启动配置与实测数据并求优化建议:
- 关键参数:-ngl 99 全层尽量上 GPU、-ncmoe 42 强制 42 个专家层留 CPU/RAM、200k 上下文、f16 K/V cache、xhigh 推理模式不截断
- 加载后 VRAM 几乎占满(剩 0.6GB),系统内存仍余约 52GB
- 实测:12k 上下文 prompt 处理稳定在约 185-190 tok/s;生成速度在 12k+ 上下文下保持约 15.5-16 tok/s
- 作者提醒近期 llama.cpp master 多个构建针对 Qwen4Exp 架构改动(MTP 投机解码回滚支持、Vulkan top-k radix sort shader、减少 graph splits),遇到 MTP 不稳先升级再怀疑配置
- 求助:-ncmoe 数值是否最优、如何压榨 prompt 处理速度、MTP 投机解码是否已在主线稳定
「Infra」频道最新
- RTX 5090 实测:NInfer、llama.cpp、vLLM 质量持平速度见分晓 — bengizmoed · 2026-09-05
- Omagrid P2P 算力网上线,Omarchy 机器直接共享 DeepSeek 与 Qwen — dee_hw · 2026-09-05
- Hugging Face 拆解 16 个开源 RL 库:异步解耦已成同步训练共识 — Thom_Wolf · 2026-09-05
- RTX 3060 跑不动开源视频模型,转向云端后失去模块化的两难 — Suspicious_Pizza9529 · 2026-09-05
- Anthropic IPO 投资人追问单 token 收入与每吉瓦算力营收 — Hesamation · 2026-09-05
- Wan2GP 桌面启动器 Tauri 版:一键装好开源视频生成全家桶 — Extension_Affect_483 · 2026-09-05