llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137%

mattescala · reddit · 2026-08-30

针对双路服务器性能因跨 Socket 读取权重而受限于互连带宽的问题,作者启用了 ggml-cpu.h 中闲置的 NUMAMIRROR 策略,在每个 NUMA 节点保留一份完整权重副本。虽然这会双倍占用内存,但让每颗 CPU 核心都能本地读取数据。实测显示,DeepSeek-V4-Flash Q8 和 GLM-5.2 Q3KXL 性能提升 64%71%,gemma-4-31B Q40 dense 推理速度更是暴涨 137%。PR 已提交至 llama.cpp。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →