同名 Q4KM 量化体积相差 150%,用户吐槽 llama.cpp 生态无标尺
ParaboloidalCrest · reddit · 2026-09-03
一位本地推理用户向 llama.cpp 社区发出「爱的吐槽」:各家量化发布者对同一模型的 Q4KM 量化体积差异惊人——以某 Qwen 模型为例,AtomicChat 版仅 94.5GB,mradermacher 的 iq4xs 为 97GB,Lmstudio 119GB,Bartowski 120GB,AesSedai 高达 135GB,而 ggml 官方只有 163GB 的 Q8。同一标签下体积差达约 150%,Q4KM 这个名字已经失去可比意义,相当于拿苹果、橘子和芒果互比。
作者质疑量化配方缺乏统一标准,甚至考虑退回自己做一个简单诚实的 Q40 量化。这反映了本地模型社区在量化命名规范与质量基准上的长期痛点。
「Infra」频道最新
- 跑本地大模型该加多少显存内存?Reddit 热议容量与速度取舍 — MiceLiceandVice · 2026-09-03
- Zeiss 称中国距 EUV 光刻机尚差 15 年,网友质疑单一供应商口径 — basedjensen · 2026-09-03
- FastVideo-FastH3 上架 MLX 页面,Mac 本地推理提速工具未发先热 — Structure-These · 2026-09-03
- AI 硬件需求拉动,韩国 8 月出口同比大增近 69% — VraserX · 2026-09-03
- RTX 5090 夜间自动生成股市简报,数字门禁杜绝 LLM 编造数据 — JakeChj · 2026-09-03
- Counterpoint:长鑫存储 Q2 DRAM 市占率达 10% — zephyr_z9 · 2026-09-03