张量级量化分配显奇效:Gemma 4 12B 编码性能提升 8.5%

devildip · reddit · 2026-08-14

一位开发者在 Hugging Face 上分享了针对 Gemma 4 12B 模型的任务感知型 GGUF 量化方案。

该方法通过特定类别的语料生成自定义 imatrix,测量量化造成的性能损失,并将固定的比特预算重新分配给那些增加精度最能恢复该类别表现的张量。

实验结果显示:

作者指出,该模型是针对特定类别刻意优化的,因此未选中类别的性能下降属于预期之内。最终目标是打造一个自动化流水线,能够接收全精度模型并自动输出指定类别和体积的最优量化版本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →