llama.cpp使用MTP推测解码时内存占用异常排查
xornullvoid · reddit · 2026-07-30
开发者在使用 llama.cpp 部署模型并启用 MTP(Multi-Token Prediction)推测解码时遇到了显存与内存分配的疑问。
- 问题现象:即使 GPU VRAM 仍有 10GB 以上剩余,系统的物理内存(RAM)占用却在持续增加。
- 核心疑问:MTP 模块是否独立于主模型加载?是否需要在参数中单独为其指定运行设备(如强制使用 CUDA)?
- 环境配置:使用了带有 --spec-type draft-mtp 等相关推测解码参数的 llama-server 启动命令。
「Infra」频道最新
- 求助:寻找原生支持64k上下文的本地 GGUF 模型 — Inner-End7733 · 2026-07-31
- Meta 开源 FBTriton:探索 GPU 编译器与 DSL 前沿优化 — PyTorch · 2026-07-31
- MIT 团队创 Atomarine:海底数据中心或成算力未来 — bosmeny · 2026-07-30
- BCG报告:仅15%私募公司具备成熟技术基础设施,AI采用受限于基础 — alex_verem · 2026-07-30
- 专家称 AI 需求增速远超供给,基础设施成核心瓶颈 — NinaDSchick · 2026-07-30
- 开源项目让手机运行120B MoE模型,速度达6 tokens/s — dai_app · 2026-07-30