Gemma 4 12B QAT 开启 MTP 推理速度反而下降的排错
NovaXeros · reddit · 2026-09-01
用户在 Radeon 6900XT 上测试 Gemma 4 12B QAT 模型时发现异常:开启 MTP (Multi-Token Prediction) 后,VRAM 占用增加但推理速度(t/s)反而下降(从 32 降至 23)。用户尝试了禁用视觉、减少上下文和更换不同源的 QAT 模型,问题依旧。目前寻求原因排查和配置建议,帖子附带了详细的 Docker 启动命令和 models.ini 配置。
「Infra」频道最新
- 腾讯 Hy4 预览版:1.25bit 量化将体积缩减 7 倍 — ccerrato147 · 2026-09-01
- Brave 浏览器开源 Rust 广告拦截引擎 adblock-rust — gnukeith · 2026-09-01
- 评论:人形机器人销量预测被指是“被遗忘的噱头” — TiernanRayTech · 2026-09-01
- Hugging Face 新增激活检查点卸载,大模型显存占用骤降 — StasBekman · 2026-09-01
- Meta 开源 MetaRoCE 协议,优化以太网 AI 集群 — Meta_Engineers · 2026-09-01
- 内存成本飙升,亚马逊连夜涨 Echo/Kindle 价 — film_girl · 2026-09-01