同名 Q4KM 量化体积相差 150%,用户吐槽 llama.cpp 生态无标尺

ParaboloidalCrest · reddit · 2026-09-03

一位本地推理用户向 llama.cpp 社区发出「爱的吐槽」:各家量化发布者对同一模型的 Q4KM 量化体积差异惊人——以某 Qwen 模型为例,AtomicChat 版仅 94.5GB,mradermacher 的 iq4xs 为 97GB,Lmstudio 119GB,Bartowski 120GB,AesSedai 高达 135GB,而 ggml 官方只有 163GB 的 Q8。同一标签下体积差达约 150%,Q4KM 这个名字已经失去可比意义,相当于拿苹果、橘子和芒果互比。

作者质疑量化配方缺乏统一标准,甚至考虑退回自己做一个简单诚实的 Q40 量化。这反映了本地模型社区在量化命名规范与质量基准上的长期痛点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →