Gemma 4 张量级量化分配实现极低预算高性能

开发者针对 Gemma 4 12B 提出任务感知的 GGUF 量化方案,利用特定类别语料生成自定义 imatrix,实现张量级量化分配(Tensor Level Quantization Allocation)。在 3.3GB 的极低存储预算下,模型可恢复 96% 的推理能力,编码性能甚至提升 8.5%,表明精细化的精度重分配能让大模型在低资源设备上大幅保留能力。

2026-08-14 ~ 2026-08-15 · 2 条相关