llama.cpp 新 PR:MoE 专家留主机内存,GPU 缓存大幅提速

jacek2023 · reddit · 2026-10-08

llama.cpp 合并中的 PR #29887 由 am17an 提交,为驻留在主机内存中的 MoE 专家权重增加 GPU 缓存。对于无法完全装入显存的 MoE 模型,这一改动可能带来显著推理加速,降低了大模型本地部署的显存门槛。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →