llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解

Ambitious_Fold_2874 · reddit · 2026-09-17

Reddit 用户求助:在 llama.cpp 中运行 unsloth 的 Qwen3.8-Flash-Next GGUF 正常,但启用 MTP(multi-token prediction)投机解码时加载 MTP 草稿模型失败,报错 tensor 'outputhcnorm.weight' not found,模型加载直接退出。用户尝试手动指定 --spec-type draft-mtp 与草稿模型路径仍无法解决,尚不确定是该 GGUF 的 MTP 层与 llama.cpp 不兼容,还是参数配置有误。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →