8GB 显卡实测 llama.cpp MoE 主存缓存:参数调优后速度反而下降
pmttyji · reddit · 2026-10-09
用户在 4060(8GB VRAM)+ 32GB DDR5 上实测 llama.cpp 新 PR #29887(将 MoE 专家权重缓存到主内存),用 Qwen3.6-35B-A3B-IQ4XS 跑了多组配置:-cmoe 默认约 23.4 t/s,但加 --moe-cache-mib 后性能不升反降——1536MiB 降到 15 t/s,2048MiB 降到 13.4 t/s,8192MiB 仅 12 t/s,提示评估速度也随缓存增大而明显下滑。作者不确定是配置错误还是实现问题,请求社区帮助并征集其他小显存用户的 t/s 数据。
「Infra」频道最新
- DGX Spark 价格被炒上天,转帖直指涨价内幕 — natesiggard · 2026-10-09
- 一周 16 万次:OpenAI 爬虫狂抓不存在的 URL,疑似新模型 RL 训练 — gaganghotra_ · 2026-10-09
- Modal 推出 LLM Engine Advisor:几条约束一键选出推理引擎与配置 — charles_irl · 2026-10-09
- LFM 2.5 5.4B 被看好适合笔记本本地运行 — Aggravating-Push-207 · 2026-10-09
- Architect Fi 推出 Liquid Inference,700+ 模型按每条 prompt 最低价竞价路由 — markjeffrey · 2026-10-09
- lithos-metal 开源:M5 Max 上单用户峰值 200+ tokens/s 跑 Qwen3.8-27B — JiaZhihao · 2026-10-09