llama.cpp 待合 PR 汇总:CPU/混合推理提速

pmttyji · reddit · 2026-08-30

汇总了 llama.cpp 仓库中 30+ 个与 CPU、RAM、磁盘及混合推理相关的待合并 PR。主要优化点包括:MoE 专家缓存与磁盘流式传输、AVX/VNNI 指令集加速、量化内核优化(RVV/NEON/AMX)、NUMA 节点镜像、KV Cache 克隆以及内存峰值控制等。这些改进旨在显著提升 CPU 和混合环境下的推理速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →