DDR5 超频实测:MoE 模型显存外推理提速最高 14%
EvolvingDior · reddit · 2026-10-06
- 在 AMD 7950X + 128GB DDR5(4x 双 rank)平台上,用 llama.cpp 的定制 SYCL 后端在 Intel B70 32GB 显卡上跑装不进显存的 MoE 模型,把内存从 3600MHz 超到 4800MHz,实测内存带宽提升 36%。
- 结果:预填(PP)提升约 10%、生成(TG)约 5%,且上下文越长提升越大——8192 上下文下 pp2048 提升 14%、tg128 提升 8.2%。
- 作者给出完整 llama-benchy 对比表(含前缀缓存测试)和完整的 llama-server 启动命令(Qwen3.8-Flash-Next 量化 GGUF + MTP 投机解码、q80 KV cache、统一 KV、262k 上下文等),可直接照抄复现。
「Infra」频道最新
- 长文拆解:Nvidia 有护城河但无垄断,Google 自研 TPU 占全球算力近四分之一 — AryHHAry · 2026-10-06
- 4090 跑 Qwen 本地模型,上下文窗口约 32k 就爆显存 — BLUECOW009 · 2026-10-06
- vLLM 集成 Transformers 后端,文本图像音频视频全模态统一推理 — LysandreJik · 2026-10-06
- 曝 DeepSeek 融资至少 120 亿美元,拟 2027 年初 IPO — teortaxesTex · 2026-10-06
- SEC 文件曝光:Anthropic 5180 亿算力承诺中 80% 不用也得付 — rohanpaul_ai · 2026-10-06
- llama.cpp 新 PR 让 Metal 上投机解码提速 3 倍 — pmttyji · 2026-10-06