llama.cpp 待合 PR 汇总:CPU/混合推理提速
pmttyji · reddit · 2026-08-30
汇总了 llama.cpp 仓库中 30+ 个与 CPU、RAM、磁盘及混合推理相关的待合并 PR。主要优化点包括:MoE 专家缓存与磁盘流式传输、AVX/VNNI 指令集加速、量化内核优化(RVV/NEON/AMX)、NUMA 节点镜像、KV Cache 克隆以及内存峰值控制等。这些改进旨在显著提升 CPU 和混合环境下的推理速度。
「Infra」频道最新
- 异构GPU实测Qwen3.8-27B:eGPU层分模式与MTP加速全解析 — CoffeeToCode99 · 2026-08-30
- 双卡实测:DeepSeek v4 跑出 67 t/s — koalfied-coder · 2026-08-30
- Zoubin Ghahramani:数据中心本质上是将电力转化为可用的智能 — irinarish · 2026-08-30
- Enter Cloud 提供全栈式开发基础设施 — FellMentKE · 2026-08-30
- Applied Compute 发布 AC2 私测版:打造模型工厂基础设施 — ypatil125 · 2026-08-30
- 背景移除模型因 lazy load 导致重复加载 — Acceptable-Work8202 · 2026-08-30