llama.cpp 新增 TENSOR_READ_LAZY,MoE 模型活跃参数不再常驻显存
jacek2023 · reddit · 2026-08-27
llama.cpp 收到 PR #27794(作者 ngxson),在 modelloader 中加入 TENSORREADLAZY 选项。核心收益是让 Qwen3 Next(社区俗称 Qwen4 预览)这类 MoE 架构中只在激活时需要的专家张量(engrams)不必常驻 VRAM/RAM,按需惰性加载,从而显著降低本地运行大模型的内存门槛。
「编程与Agent」频道最新
- 模型之外你配了什么?聊聊 agent 的脚手架全家桶 — External-Wind-5273 · 2026-08-27
- Codex 用户吐槽:宁可少 5% 额度,也想让进行中的任务跑完 — vinmi · 2026-08-27
- qmax-mcp:给编码代理用的本地 QA 工具,一条命令跑 Playwright 复现 — bestofdesp · 2026-08-27
- 为Apple端侧模型打造MCP客户端SDK,动态生成Tool无需适配器 — AdventurousKeys · 2026-08-27
- Remotion Studio支持WebMCP:Agent可感知用户选择并上下文操作 — Vjeux · 2026-08-27
- Agent 撞上没见过的数据表怎么办?无共享主键难题求破解 — No-Plant-5234 · 2026-08-27