实测 Gemma 4 QAT:KV Cache 量化表现大幅提升
Anbeeld · reddit · 2026-08-12
作者使用 BeeLlama.cpp 对比了 Gemma 4 31B 模型在标准量化与 QAT(量化感知训练)下的 KV Cache 量化表现。基准测试表明,QAT 模型对 KV Cache 量化展现出了极强的亲和力。
数据显示,在各项指标中 QAT 均有显著改善。例如在 Q40 精度下,QAT 将 KLD(KL 散度)降低了近 10 倍,同时 Same-top(预测一致性)提升了约 15 个百分点。这证明了 QAT 能够在大幅压缩显存占用的同时,更有效地保持模型的长文本处理能力。
「模型」频道最新
- LiquidAI 发布 3B 轻量级视觉语言模型,多项跑分越级胜出 — JosephJacks_ · 2026-08-13
- 悬置21年数学难题被人类破解,GPT与Claude均告失败 — anshulkundaje · 2026-08-13
- 像艺术评论家一样评测 AI:Grok 4.6 占星能力实测 — karinanguyen · 2026-08-13
- Kimi K3 接入 GitHub Copilot,实测一句话生成游戏 — film_girl · 2026-08-13
- MiniMax H3 实测对比 SD2.5:运镜更平滑,商业可用性占优 — FellMentKE · 2026-08-13
- 80张RTX 5090跑满Kimi K3全量模型,Bittensor网络提供半价平替API — markjeffrey · 2026-08-13