结构压缩后再量化到4-bit,QAH让60B学生七项反超16位源

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

cs.CL, cs.AI, cs.LG, cs.PF

2026-08-21

结构压缩再量化会打残推理、数学和代码。QAH让4-bit 60B在九项里七项追上或超过bfloat16源,峰值约比QAT快七倍且继续训也不崩。

这篇在解决什么

把大模型送到线上,现在经常是两刀连砍:先改架构把参数砍掉一半,再量化到 4 bit。两刀叠在一起,推理、数学、代码和长上下文都会掉一截,必须再做一轮回血,行业里叫 healing。

默认配方是 quantization-aware training(QAT):前向插 fake-quantizer,用硬标签交叉熵把量化学生再训回去。Multiverse Computing 在自家管线里发现,QAT 收敛慢,过了峰值还会崩,安全上线得靠手调 early stopping。NVIDIA 的 quantization-aware distillation(QAD)用冻结的全精度副本当老师,只量化、不改结构时说得通。结构压缩之后,能拿到的 bfloat16 检查点本身就是从原模型蒸馏回来的近似,已经带着容量损失。再拿它当老师,学生的天花板就被钉死了。

方法

QAH 换老师:4-bit 学生直接向压缩前的原模型蒸馏,不再向恢复出来的 bfloat16 检查点对齐。老师和学生结构不同,监督只走输出分布,跟 DistilBERT、TinyBERT 那类跨架构蒸馏同一逻辑。

损失是温度 τ=1 的 KL,学生前向插 MXFP4 fake-quantizer,反向用 straight-through estimator。老师 logit 离线预计算,只存 top-100,学生全程看不到硬标签。工程上用离线 top-k 加分块 fused KL,峰值中间显存从 O(BLV) 降到随序列长度线性增长,32k 上下文才能和短上下文 QAT 共用同一套硬件。

管线分两段。先用张量网络算子把 GPT-OSS 120B 压到 60B(另有一条 20B 压到 9B 的内部部署),在 bfloat16 下用 KL 从原模型恢复;再把恢复后的检查点重新量化到 MXFP4,第二次蒸馏仍指向未压缩老师。这第二次才叫 QAH。embedding、layer norm 和部分 attention 冻结,高学习率下解冻这些模块会把检查点训得比未回血的 MXFP4 还差。

对照是同一套 fake-quantizer 上的 QAT,只把 KL 换成 next-token 交叉熵。

结果

主结果在 GPT-OSS 120B 到 60B 再到 MXFP4。4-bit QAH 学生在 9 项里有 7 项追上或超过自己的 bfloat16 源,权重显存大约是 16 位学生的四分之一,参数量是老师的一半。LiveCodeBench 上 66.5,对 120B 老师的 66.0,论文按噪声读成打平。

设置指标数字
QAH 60B vs 自身 bf16AA-LCR42.7 vs 35.3(+7.4)
同上AIME 202576.3 vs 70.7(+5.6)
同上Aider40.9 vs 38.2(+2.7)
同上τ²-bench61.7 vs 59.4(+2.3)
同上MMLU-Pro / SciCode低 0.2 / 低 1.4
QAH 60B vs 120B 老师LiveCodeBench66.5 vs 66.0
同上GPQA Diamond67.4 vs 69.0
同上AA-LCR仍低 7.3

QAH 对 QAT 的对照在 20B 压到 9B 再量化这条线上,看 MMLU-Pro、LiveCodeBench、GPQA Diamond 的平均分。QAH 约 100 步到峰值 54.9,一直训到 1200 步仍停在峰值附近约 2 分内;QAT 约 700 步才到 54.6,到 1200 步掉到大约 36,丢了将近 19 分。步数大约少 7 倍。60B 上 QAH 约 400 步到峰。

分布式后端也不是中性选项。120B 学生的 QAT 扫了 11 组配置:FSDP2 最好的 GPQA Diamond 是 73.74,DeepSpeed ZeRO-3 全组最高停在 65.15,差 8.6 分。MMLU-Pro 是 70.95 对 69.45,AIME 2025 是 80.00 对 76.67。

为什么重要

给「先砍结构再砍精度」的部署队一条能直接跑的配方,不用多周搜超参。量化这一步从尽量少掉点,变成第二次拿老师监督的机会:4-bit 成品可以比它自己的 16 位源更强,同时更便宜。Hypernova-60B 已按 Apache 2.0 开源;论文数字是这条管线的测量,公开权重还叠了后续训练。

只量化、不改结构时,标准 QAD 仍然更对口。QAH 针对的是复合压缩。

局限与存疑

最该补的实验没做:同配置下,从原模型蒸馏对从恢复 bfloat16 蒸馏。老师天花板是论证,不是实测。全部单次运行,没有 seed 方差;AIME 2025 只有 30 题。只测了 GPT-OSS MoE、MXFP4、一份 Nemotron 加 SmolTalk 混合物。压缩算子是私有的,没验证切到剪枝、SliceGPT、低秩分解是否还成立。老师 GPT-OSS 权重本身已经大量是 MXFP4,优势来自未压缩,不是来自更高精度。DeepSpeed 掉点怀疑和混合精度通信路径有关,没有定位到具体实现。

术语

原文与代码

相关论文

全部论文解读