Qwen 模型双卡推理优化:预填提速 10 倍实战
Comrade_Mugabe · reddit · 2026-08-28
在双 RTX 3060 + 7800X3D 环境下测试 Qwen3.8-Flash-Next 模型,作者发现 llama.cpp 默认的 -sm tensor 模式会导致 MoE 权重回退到 CPU,预填速度仅 36 tps。切换至 -sm layer 并调整 -ubatch 2048 后,预填速度飙升至 400 tps。测试还对比了 ikllama.cpp,指出其无此陷阱且速度相当,但内存占用比 llama.cpp 多约 75 GB。文章提供了具体的参数配置建议和性能数据,适合本地部署参考。
「Infra」频道最新
- 本地 AI 的真正价值是数据主权而非省钱 — StewartalsopIII · 2026-08-28
- 英伟达联手华尔街推5000亿算力融资,被指引爆次贷危机 — 创业邦 · 2026-08-28
- RTX 3060 12GB:本地 AI 性价比之王实测 — I_Play_Zed · 2026-08-28
- Qwen3.8-Flash 开源:卷死 DeepSeek,4090 跑 1M 上下文 — 量子位 · 2026-08-28
- 用 Langfuse 轨迹分析自动改进 Agent 工作流 — NielsRogge · 2026-08-28
- 英伟达助筹 5000 亿美元基建,不仅卖铲子还开矿 — VraserX · 2026-08-28