审计 443 个 GGUF 模型:64 个文件名与实际量化不符
Daxfortuna · reddit · 2026-08-29
作者审计了 25 个仓库共 443 个 GGUF 量化模型,发现 64 个模型的实际量化方式与文件名声称不符。
问题原因:
K-quants 和 i-quants 要求首个张量维度能被 256 整除。若不满足,llama-quantize 会静默回退到兼容类型(如 IQ4NL 或 Q40)。这导致标称极低比特(如 IQ2XXS)的模型实际比特率接近 4.5,压缩效果远低于预期。
受影响案例:
- Nemotron-3.5-Lightning:约 99% 参数被强制回退,不同标称档位(2.06-2.56 bpw)实测均为 4.58 bpw。
- Qwen3.8-Flash-Next:51.9% 参数强制回退。
- Nemotron-3-Super-120B:23 个量化档位中有 18 个包含回退。
清洁案例:
MiniMax-M2.1、byteshape 的 Qwen3.6 量化及 bartowski 的 Ornith-1.5 均无强制回退,标签准确。
建议:下载低比特量化时,若文件名无法保证真实性,不如选择标注诚实的 Q40 或 IQ4NL,避免盲目追求标称压缩比。
「Infra」频道最新
- Conifer SDK 开源:统一推理网关与计费 — ycombinator · 2026-08-29
- MiniMax H3 Max 视频生成快 24 倍,刷新帕累托前沿 — JenniferHli · 2026-08-29
- Ruff 引入 PGO 优化,性能提升 8-15% — charliermarsh · 2026-08-29
- MiniMax 发布 Fast H3 v1 开源加速方案 — ArashVahdat · 2026-08-29
- 预测市场:英伟达年底蝉联最大公司概率 76% — Polymarket · 2026-08-29
- FreeToken 引擎:8G 显存本机流畅跑 35B 模型 — rohanpaul_ai · 2026-08-29