Qwen 模型双卡推理优化:预填提速 10 倍实战

Comrade_Mugabe · reddit · 2026-08-28

在双 RTX 3060 + 7800X3D 环境下测试 Qwen3.8-Flash-Next 模型,作者发现 llama.cpp 默认的 -sm tensor 模式会导致 MoE 权重回退到 CPU,预填速度仅 36 tps。切换至 -sm layer 并调整 -ubatch 2048 后,预填速度飙升至 400 tps。测试还对比了 ikllama.cpp,指出其无此陷阱且速度相当,但内存占用比 llama.cpp 多约 75 GB。文章提供了具体的参数配置建议和性能数据,适合本地部署参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →