8GB 显卡实测 llama.cpp MoE 主存缓存:参数调优后速度反而下降

pmttyji · reddit · 2026-10-09

用户在 4060(8GB VRAM)+ 32GB DDR5 上实测 llama.cpp 新 PR #29887(将 MoE 专家权重缓存到主内存),用 Qwen3.6-35B-A3B-IQ4XS 跑了多组配置:-cmoe 默认约 23.4 t/s,但加 --moe-cache-mib 后性能不升反降——1536MiB 降到 15 t/s,2048MiB 降到 13.4 t/s,8192MiB 仅 12 t/s,提示评估速度也随缓存增大而明显下滑。作者不确定是配置错误还是实现问题,请求社区帮助并征集其他小显存用户的 t/s 数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →