Gemma 4 31B 量化加速:Q4_K 草稿模型提升 10% 解码速度
eightone-81 · reddit · 2026-08-07
一位开发者在双 3090 显卡上测试了 Gemma 4 31B 模型的推理加速。通过将 f16 MTP 草稿模型量化为 Q4K 格式(而非 unsloth 默认的 Q40),解码速度提升了约 10%(从 65 TPS 升至 72 TPS)。
作者还尝试了 Q2K 量化,但效果大幅下降。该实测为本地部署大模型的量化策略提供了参考。
「Infra」频道最新
- 特斯拉与 SpaceX 合建超 1000 万平方英尺算力工厂 — scaling01 · 2026-08-07
- 曝 DeepSeek 恢复 80 亿美元融资,用于数据中心建设 — scaling01 · 2026-08-07
- RTX 3060 跑 MiniMax H3 视频:Turbo LoRA 实现 6 步生成 — irmemon225 · 2026-08-07
- Cloudflare 推出 Kitesurf:专为 AI 智能体打造的轻量级浏览器 — craigsdennis · 2026-08-07
- SpaceX与特斯拉拟豪掷168亿美元建芯片厂 — pstAsiatech · 2026-08-07
- Together AI 分享更新版推理平台:聚焦开源模型生产部署 — togethercompute · 2026-08-07