Gemma 4 31B 量化加速:Q4_K 草稿模型提升 10% 解码速度

eightone-81 · reddit · 2026-08-07

一位开发者在双 3090 显卡上测试了 Gemma 4 31B 模型的推理加速。通过将 f16 MTP 草稿模型量化为 Q4K 格式(而非 unsloth 默认的 Q40),解码速度提升了约 10%(从 65 TPS 升至 72 TPS)。

作者还尝试了 Q2K 量化,但效果大幅下降。该实测为本地部署大模型的量化策略提供了参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →