实测 Gemma 4 QAT:KV Cache 量化表现大幅提升

Anbeeld · reddit · 2026-08-12

作者使用 BeeLlama.cpp 对比了 Gemma 4 31B 模型在标准量化与 QAT(量化感知训练)下的 KV Cache 量化表现。基准测试表明,QAT 模型对 KV Cache 量化展现出了极强的亲和力。

数据显示,在各项指标中 QAT 均有显著改善。例如在 Q40 精度下,QAT 将 KLD(KL 散度)降低了近 10 倍,同时 Same-top(预测一致性)提升了约 15 个百分点。这证明了 QAT 能够在大幅压缩显存占用的同时,更有效地保持模型的长文本处理能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →