llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137%
mattescala · reddit · 2026-08-30
针对双路服务器性能因跨 Socket 读取权重而受限于互连带宽的问题,作者启用了 ggml-cpu.h 中闲置的 NUMAMIRROR 策略,在每个 NUMA 节点保留一份完整权重副本。虽然这会双倍占用内存,但让每颗 CPU 核心都能本地读取数据。实测显示,DeepSeek-V4-Flash Q8 和 GLM-5.2 Q3KXL 性能提升 64%71%,gemma-4-31B Q40 dense 推理速度更是暴涨 137%。PR 已提交至 llama.cpp。
「Infra」频道最新
- TensorSharp 集成 MiniMax H3,实现本地图生视频推理 — fuzhongkai · 2026-08-30
- Qwen N-gram 机制利用 51B 表增强 Token — antirez · 2026-08-30
- 双 DGX Spark 跑 Qwen3.8-Flash-Next:解码 50t/s、预填充 2900t/s — -dysangel- · 2026-08-30
- 本周 SEC 文件盘点:50MW 算力合作、银行 agent 工作区全上线 — Justgototheeffinmoon · 2026-08-30
- Qwen 3.8 Flash Next 架构解析:利用 Next-n-grams 优化推理 — antirez · 2026-08-30
- Qwen 3.8 Flash Next 量化版或成 64GB Mac 本地推理优选 — antirez · 2026-08-30