llama.cpp 更新:默认加载 MTP 张量致显存多耗一层
Shoddy_Bed3240 · reddit · 2026-07-30
近期 llama.cpp 的构建版本改变了张量加载逻辑:对于包含 MTP/NextN 张量的模型(如 GLM-5.2、Qwen3 等),即使未启用投机解码,也会默认加载这些张量。
这会带来额外的显存/内存消耗(约等于多加载一个 MoE 层)。由于目前社区制作的大多数 GGUF 模型默认打包了 MTP 块,这一改动将普遍影响本地部署的硬件资源占用,开发者需留意内存溢出(OOM)风险。
「Infra」频道最新
- AI 算力投资远超现金流:谷歌资本支出暴增 107% — Beth_Kindig · 2026-07-30
- Cerebras 谈 Agent 时代:新工作流将催生非 GPU 芯片架构 — sarahookr · 2026-07-30
- Cognition 实验室访谈:强化学习与推理优化正走向融合 — AAAzzam · 2026-07-30
- Vector Institute 拆解 MoE:4-bit 量化与 Flash Attention 2 部署实践 — VectorInst · 2026-07-30
- 云GPU部署LTX视频模型踩坑记:附自动化安装方案 — Humble_Cut6799 · 2026-07-30
- NVIDIA 预计将 RTX GPU 价格再上调最高 30% — ANR2ME · 2026-07-30