5090+3090 双卡实测:llama.cpp 调优让预填快 4 倍
Blindax · reddit · 2026-09-22
Reddit 用户在 Ryzen 9800X3D + 128GB 内存 + RTX 5090/3090 双卡上,用 llama.cpp 跑 Qwen3.8-27B 与 Flash-Next(60k–160k 上下文)并逐项测量,得出多条可复用的调优结论:
- lazy-mode 回归坑:新版 llama.cpp 将大 embedding 表延迟映射,专家权重放内存时 prefill 从 1220 t/s 掉到 704 t/s,关掉 lazy-mode 并用 load-mode none 最快。
- 专家放内存时 ubatch 比专家层数更重要:ubatch 2048→4096 提速 31%,因为更大的 micro-batch 减少每 token 的权重传输。
- 双卡切分时 batch 应保持 ubatch 的 3-4 倍:batch=ubatch 会让两卡串行而非流水线重叠,prefill 从 2702 掉到 2040 t/s。
- 27B 单卡 5090 反而更快:Q6 单卡 prefill 2766 t/s、decode 100 t/s,优于 Q8 双卡切分(2687/69.5),默认单卡 128k,超长才用双卡。
- 262k 上下文时 compute buffer 会挤到第二张卡,ubatch 需降回 1024。
- MTP 投机解码 draft=3 是甜点:decode +12%,draft=4 几乎无增益;接受率 68-75%,且在代码、数值推理等任务同样有效,decode 速度主要受上下文长度限制。
「Infra」频道最新
- Lisa Su 执掌 AMD 十一年:市值从 20 亿涨到 1 万亿美元 — xiaosun86 · 2026-09-22
- 黑石今年砸近千亿美元于数据中心,称 AI 投资热并非互联网泡沫重演 — JOBhakdi · 2026-09-22
- Modular 开源 LLM 推理手册:20+ 交互可视化覆盖全栈优化 — carrycooldude · 2026-09-22
- Naveen Rao All-In 演讲:AI 极低效、算力缺电、1945 年来计算机都造错了 — NaveenGRao · 2026-09-22
- GKE Pod snapshots 将 AI 推理冷启动缩短 89%,70B 模型 37 秒加载 — rseroter · 2026-09-22
- M5 Ultra 跑 Qwen 3.8 Flash Next 预填充达 3100 tok/s — GabGarrett · 2026-09-22