只重训 fp16 scale,让 3-bit GGUF 更贴近 BF16 原模型
ZenZombie117 · reddit · 2026-09-17
Reddit 用户分享了一项量化后恢复(post-hoc scale recovery)实验:在不改变 GGUF 整数编码、字节数与加载器的前提下,只对每个量化块的 fp16 scale/dmin 字段做端到端重训,以 BF16 原模型的 next-token 分布为监督。
- 起因:对 30B 模型剪掉 6.34% FFN 后,Q4K 下保真度差 0.006 KLD 无法通过,作者转向优化「量化误差」这一项。
- 对第三方 ISTA-DASLab 的 Qwen3.8-27B IQ3S 文件重训了 399 个张量、约 1.04 亿个块,用 0.6M token 上 top-64 forward KL 训练 300 步。
- 结果:mean KLD 0.0480→0.0450,top-1 86.60%→87.20%,500 个位置中 261 个改善,但配对 95% 区间为 [-0.0098, +0.0038],只能说是「方向一致、幅度未定」。
- HellaSwag 上恢复前后与原模型差异在误差范围内,任务精度并未提升;作者强调保真度与基准成绩是两个不同的量。
- 结论:scale-only recovery 是任何量化制作者都能在现有 GGUF 上运行的廉价后处理步骤,无需重新量化,技术上等同 EfficientQAT 第二阶段用于成品文件。
- 文件、训练记录与基准原始数据均在 Hugging Face,作者自研的 C 二进制训练器 Xyntetik Runner 以 Apache 2.0 开源。
「Infra」频道最新
- Qwen3.8-Flash-Next 实测:254K 长上下文首 token 提速 1.56 倍 — FantasticNature7590 · 2026-09-17
- 隐私 LLM 服务 Venice 日处理 token 量达 2500 亿,三月翻 2.5 倍 — 0xAllen_ · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型首次获服务端实时联网搜索 — baseten · 2026-09-17
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- Starlink 拉美农村联网大扩张:洪都拉斯万台天线连 8000 所学校 — NicoVerderosa · 2026-09-17
- 新论文突破 1.58-bit 界限,三值 LLM 量化再进一步 — matt_d · 2026-09-17