Gemma 4 量化研究:仅靠重分配精度恢复 96% 推理能力
devildip · reddit · 2026-08-15
研究展示了通过 Tensor Level Quantization Allocation(张量级量化分配)在极低预算下的惊人效果。
核心成果:
- 在 3.3GB 的 IQ2XXS 极限压缩下,推理分数从 28.9 提升至 69.5,提升了 140.54%。
- 最终模型仅占 BF16 原模型大小的 24%,但保留了 96.74% 的推理性能。
- 11 个评测类别中有 10 个超越了 imatrix 基准,仅稳定性略有下降。
方法原理:
- 不涉及后训练、LoRA 或剪枝。
- 基于特定类别的语料库构建 imatrix,测量损伤后,在固定字节预算下于张量级别重新分配精度。
各项保留率:
- 知识 QA: 97.50%
- 上下文: 95.83%
- 指令跟随: 81.25%
- 编码: 58.49%
所属事件:Gemma 4 张量级量化分配实现极低预算高性能(2 条相关)→
「模型」频道最新
- Qwen3.8-27B 无审查 GGUF 版登顶 HF — JonathanColetti · 2026-08-15
- 实测 Qwen3.8 比 3.6 安全判断更成熟 — thomble · 2026-08-15
- Qwen3.8-27B GGUF 版本 24 小时获赞千次 — danielhanchen · 2026-08-15
- Claude 或推内置模型对比与记忆开关功能 — testingcatalog · 2026-08-15
- OpenAI 员工透露:ChatGPT 即将迎来多项速度优化提升 — borowcy · 2026-08-15
- Qwen3.8-27B开源模型上线,支持原生多模态与26.2万上下文 — const_reborn · 2026-08-15