Gemma 4 12B QAT 开启 MTP 推理速度反而下降的排错

NovaXeros · reddit · 2026-09-01

用户在 Radeon 6900XT 上测试 Gemma 4 12B QAT 模型时发现异常:开启 MTP (Multi-Token Prediction) 后,VRAM 占用增加但推理速度(t/s)反而下降(从 32 降至 23)。用户尝试了禁用视觉、减少上下文和更换不同源的 QAT 模型,问题依旧。目前寻求原因排查和配置建议,帖子附带了详细的 Docker 启动命令和 models.ini 配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →