审计 443 个 GGUF 模型:64 个文件名与实际量化不符

Daxfortuna · reddit · 2026-08-29

作者审计了 25 个仓库共 443 个 GGUF 量化模型,发现 64 个模型的实际量化方式与文件名声称不符。

问题原因:

K-quants 和 i-quants 要求首个张量维度能被 256 整除。若不满足,llama-quantize 会静默回退到兼容类型(如 IQ4NL 或 Q40)。这导致标称极低比特(如 IQ2XXS)的模型实际比特率接近 4.5,压缩效果远低于预期。

受影响案例:

清洁案例:

MiniMax-M2.1、byteshape 的 Qwen3.6 量化及 bartowski 的 Ornith-1.5 均无强制回退,标签准确。

建议:下载低比特量化时,若文件名无法保证真实性,不如选择标注诚实的 Q40 或 IQ4NL,避免盲目追求标称压缩比。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →