llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解
Ambitious_Fold_2874 · reddit · 2026-09-17
Reddit 用户求助:在 llama.cpp 中运行 unsloth 的 Qwen3.8-Flash-Next GGUF 正常,但启用 MTP(multi-token prediction)投机解码时加载 MTP 草稿模型失败,报错 tensor 'outputhcnorm.weight' not found,模型加载直接退出。用户尝试手动指定 --spec-type draft-mtp 与草稿模型路径仍无法解决,尚不确定是该 GGUF 的 MTP 层与 llama.cpp 不兼容,还是参数配置有误。
「Infra」频道最新
- 芯片演进三阶段论:2015年后CMOS缩放只剩能效红利 — blelbach · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17
- 美联储三年来首次加息,抬高债务驱动 GPU 集群的融资门槛 — rohanpaul_ai · 2026-09-17
- GGUF 显存计算器走红:读文件头精确判断量化模型能否塞进你的 GPU — asankhs · 2026-09-17
- 96GB M3 Ultra 跑什么?Qwen3.5-122B-A10B 达约 1000 tok/s — infieldmitt · 2026-09-17
- 预测:18个月内Kimi K3级智能将跑在单张RTX 5090上 — TheZachMueller · 2026-09-17