llama.cpp 新增 TENSOR_READ_LAZY,MoE 模型活跃参数不再常驻显存

jacek2023 · reddit · 2026-08-27

llama.cpp 收到 PR #27794(作者 ngxson),在 modelloader 中加入 TENSORREADLAZY 选项。核心收益是让 Qwen3 Next(社区俗称 Qwen4 预览)这类 MoE 架构中只在激活时需要的专家张量(engrams)不必常驻 VRAM/RAM,按需惰性加载,从而显著降低本地运行大模型的内存门槛。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →