QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction
Vincent Counathe, Ben Athiwaratkun, Christopher De Sa, Tianyi Zhang
cs.LG, cs.CL, stat.ML
2026-08-14
QUASAR在QAT每步用Adam二阶矩当显著性,搜索截断并加权拟合反量化。INT2上KL再降约29%,八项平均准确率高3.5到4.3分,直接低比特学数学比先全精度再PTQ高10.9分。
推理已经在往 INT4、NVFP4 走,PTQ 在 2、3 bit 上很脆:同样格式的 GPTQ、AWQ 把 Qwen3-4B-Thinking 的 GSM8K 打到接近 0。QAT 把量化塞进训练,本该让模型适应部署精度,优化对象却是错位的。
前向和损失走的是量化再反量化后的重建权重 r,优化器更新的是潜在全精度权重 w。量化几乎处处梯度为 0,只能靠 straight-through estimator,把在 r 处算的梯度直接当成 w 的方向。r 和 w 差得远,这条借来的梯度就不是 w 的下降方向,训练会停在比全精度更高的损失地板上。
二阶 PTQ 用 Hessian 加权的重建误差来压这个缝,但那是对冻住的模型做一次,动辄分钟到小时。QAT 里 w 每步都在变,把 GPTQ 整段重跑不现实。缺口就在这儿:重建误差控制着 QAT 的轨迹,训练循环里却没有持续、便宜的优化手段。
QUASAR 只改一件事:w 到 r 的映射。反传仍走 STE,推理仍是普通分组量化,多出来的只有训练时的重建。
显著性来自 Adam、AdamW 已经在维护的二阶矩,当作对角 Fisher,给每个权重一个 hi。组内 g 个权重共享同一套 scale 和 zero-point,误差只能在组里挪,hi 大的权重要更准,不重要的可以多错一点。
重建分两段。先搜截断范围:把组的中心和半宽按因子 f 从 0.30 到 1.00、步长 0.05 缩放,每个 f 给出一套整数码。码定死之后,s 和 z 有闭式加权最小二乘解,直接最小化显著性加权的重建平方误差。最后留误差最小的那套。Qwen3-4B 的 INT3 蒸馏里,99.6% 的组选了比 min-max 更窄的范围,损失感知误差降到全范围的 69%。
NVFP4 同一套逻辑:组内在 E2M1 网格上搜码,再拟合 FP8 反量化 scale;张量级 FP32 scale 仍用绝对值最大,不优化。部署时存的就是这些 scale,推理路径不变。
理论把 STE-SGD 的收敛界拆成三项:初始化、minibatch 噪声、损失感知重建误差。只有第三项依赖重建映射,也正是每步在最小化的量。再加上 Polyak–Łojasiewicz 条件,同一项还控制最终量化模型的损失上界。实验主设定用 AdamW,作者用纯 SGD 复测过 INT2,排序不变。
量化感知蒸馏的教师是同一份全精度模型,数据 Open-PerfectBlend,4096 步。权重 INT2/3/4、组大小 128,激活和 embedding 仍是 BF16。
Qwen3-4B-Thinking-2507 的 held-out KL:
| 位宽 | QUASAR | 最强 QAT 对照 | 最强同格式 PTQ |
| INT2 | 0.126 | Denoising QAT 0.179 | GPTQ 1.140 |
| INT3 | 0.054 | Denoising QAT 0.060 | GPTQ 0.130 |
| INT4 | 0.016 | Denoising/BitDistiller 0.018 | GPTQ 0.027 |
INT2 八项平均准确率 53.2,比 BitDistiller 的 48.9 高 4.3 分,教师 66.1。GSM8K 上 68.8 对 BitDistiller 49.0,PTQ 是 0.0–0.2。Llama-3.1-8B-Instruct 同一设定:INT2 KL 0.105 对 BitDistiller 0.151,平均准确率 59.5 对 56.0,GSM8K 66.4 对 53.1,距教师 70.1 只差 3.7 分。
INT3、INT4 的 KL 仍是最低,任务分差收窄。Qwen INT3 平均准确率 LSQ 是 63.4,QUASAR 是 62.7,KL 赢了、平均分没有。INT4 两边都贴着教师,Qwen 65.6 对教师 66.1,Llama 69.4 持平教师。
更硬的设定是直接在低比特上学新能力。Qwen3-4B-Base 在 OpenMathReasoning 上做监督微调,INT2 五科平均 29.6,最强 QAT 对照 18.7,先全精度微调再 GPTQ 只有 0.6。MATH-500 是 60.7 对 QAT 基线 39.2、全精度微调 83.8。AIME'24 仍只有 4.0,全精度微调是 22.9,长推理痕迹保住了一部分,没有保完。
NVFP4 在 Qwen3-8B 和 Qwen3.5-9B 上,held-out KL 从 0.016 降到 0.011、从 0.009 降到 0.006,大约降 30%,九项平均准确率高 0.5–0.8 分,评估走 vLLM 真实 NVFP4 路径。
消融里,每步做 scale search 是大头:只搜截断、均匀拟合,KL 从 0.175 降到 0.114;只用 Adam 加权、不搜截断,只降到 0.164。8×H100 上 INT3 一步 2.972 秒对标准 QAT 的 2.930 秒,多 1.4%。
这条路不改部署格式。训练完的 checkpoint 就是普通分组整数或 NVFP4,没有 Hadamard,没有 codebook。2-bit 同格式 PTQ 基本不可用的时候,QAT 的重建质量决定模型还能不能算数学。对已经在跑 QAT 的人,这是把 GPTQ 那类二阶思想折进前向、几乎不增加步时的补丁,不是新的推理栈。
INT4 上这是渐进改进。真正拉开的是 2-bit,以及直接在目标精度上教新能力,而不是全精度教完再压一次。
Hessian 用的是对角 Fisher 和 Adam 二阶矩,不是 GPTQ 那种层内相关矩阵;截断因子是 0.05 一档的网格搜索,不是连续最优码。主实验只重量化,激活保持 BF16,跟 W4A4 的 NVFP4 实验不是同一约束。数字停在 4B–9B,没有 70B 级结果。Qwen INT3 出现 KL 最低但平均任务分略低于 LSQ,说明 KL 地板和下游分不是同一件事。INT2 数学相对 QAT 基线跳得大,相对全精度微调仍差一截,尤其 AIME 和 HMMT。论文没有单独的局限节,这些边界是读实验设置读出来的。