llama.cpp 更新:默认加载 MTP 张量致显存多耗一层

Shoddy_Bed3240 · reddit · 2026-07-30

近期 llama.cpp 的构建版本改变了张量加载逻辑:对于包含 MTP/NextN 张量的模型(如 GLM-5.2、Qwen3 等),即使未启用投机解码,也会默认加载这些张量。

这会带来额外的显存/内存消耗(约等于多加载一个 MoE 层)。由于目前社区制作的大多数 GGUF 模型默认打包了 MTP 块,这一改动将普遍影响本地部署的硬件资源占用,开发者需留意内存溢出(OOM)风险。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →