EdgeRazor:1.88-bit 量化小模型反超 2-bit 与 3-bit 基线

EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation

Shu-Hao Zhang, Le-Tong Huang, Xiang-Sheng Deng, Xin-Yi Zou, Chen Wu, Nan Li, Shao-Qun Zhang, Zhi-Hua Zhou

cs.LG, cs.AI

2026-04-10

南大 LAMDA 与微软的 EdgeRazor 用混合精度+蒸馏把 Qwen3-0.6B 压到 1.88-bit,在 14 项任务上反超所有 2-bit 与 3-bit 基线,1.58-bit 版解码快 15 倍。

这篇在解决什么

把大语言模型塞进手机这类资源受限设备,4-bit 以下的极端量化几乎是必经之路,但这恰好是现有方法崩掉的地方。训练后量化(PTQ)在 4-bit 还能近乎无损,一旦降到 2-bit、1.58-bit 就大幅掉点;量化感知训练(QAT)能救回来,但要砸算力和大语料重新训练。折中的量化感知蒸馏(QAD)又卡在三个老毛病上:bit 怎么分靠经验、拿哪几层做蒸馏靠拍脑袋、蒸馏损失只认一种数据分布。EdgeRazor 冲的就是这三处。

方法

EdgeRazor 全称是混合精度量化感知蒸馏(MPQAD),三个模块各打一个老毛病。

结构化混合精度(SQMP) 解决 bit 分配。它把每 ⌊1/ρ⌉ 个连续输出通道编成一个 super-group,组内一条通道给 4-bit、其余给 1.58-bit,ρ 控制 4-bit 的比例(ρ=1/8 对应 1.88-bit,ρ=0 对应 1.58-bit),不再逐通道去算「谁敏感就给谁多 bit」。这么设计是因为 QAT/QAD 训练时权重持续更新,初始化时算出来的「重要通道」到训练中段早就漂走了,PTQ 那套静态敏感性分配在训练里根本不成立。周期性的固定结构直接绕开「追着漂移的重要性跑」这件事。

层自适应特征蒸馏(LAFD) 解决选哪几层。它算相邻两层输出的平均余弦相似度,挑相似度最低的 k 层做特征对齐,这些层表征方向变化最大。作者在附录里给出关键证据:哪几层最擅长改造表征跟领域强相关,数学语料和代码语料的关键层分布完全不同。所以「固定选第 N 层」这类启发式从根上就错了,让重要性从老师网络自己身上算出来比人拍板靠谱。

熵感知 KL 散度(EAKLD) 解决损失函数。logit 蒸馏要在前向 KL(覆盖老师所有输出模式)和反向 KL(只追老师最强的那个模式)之间找平衡。老的 CAKLD 用固定判据切换,前提是训练数据分布稳定;但真实语料常混了人工标注和外部蒸馏合成的数据,两者熵谱不一样,固定切换会失配。EAKLD 拿老师输出的熵当开关:熵高(老师自己也不确定)就多用前向 KL 去覆盖,熵低(老师很笃定)就多用反向 KL 去贴合峰值。

三个模块的共同思路是把原本要人定或会随训练漂移的判断,换成从数据或老师网络自己算出来的自适应量。

结果

主战场是 Qwen3-0.6B,14 项领域任务取平均。更难的权重+激活量化(weight-activation)设置下:

设置EdgeRazor最强基线差距
1.88-bit41.762-bit OmniQuant 30.49+11.27
1.88-bit41.763-bit FlatQuant 37.38+4.38
4-bit47.80FlatQuant 45.74+2.06

1.88-bit 的 EdgeRazor 同时打赢了所有 2-bit 和 3-bit 基线。在仅权重量化下,4-bit EdgeRazor 平均 47.83,比 BF16 原模型还高 0.48,基本无损。对量化最敏感的 GSM8K 数学推理和 HumanEval 代码生成上,大多数 2-bit 基线掉到接近零分,EdgeRazor 还撑得住。

迁移性上,MobileLLM-350M 在每一个 bit 档位 EdgeRazor 都赢过用 QAT 微调的 ParetoQ,而训练消耗的 token 只有后者的 1/4 到 1/10。多模态 Qwen2.5-Omni-7B 在 4-bit 下,EdgeRazor(额外带一个 4-bit 视觉编码器)在 Video-MME 上比 AWQ 高 0.44、MLVU 上高 1.42。

部署效率(1.58-bit Qwen3-0.6B,Apple M4 Pro,llama.cpp):存储从 1.11 GB 压到 0.19 GB,显存从 1.46 GB 降到 0.51 GB,prefill 速度 2.11 倍,解码 15.16 倍(20.91 → 317.03 tokens/s)。groupsize 取 256 时量化比例做到 99.99%,连 embedding 和 lmhead 都量化进去。

为什么重要

对要在端侧跑 LLM 的人,这是「2-bit 以下终于可用」的直接证据。过去 sub-4-bit 基本等于废模型,EdgeRazor 把可用线推到了 1.88-bit 甚至 1.58-bit,而且不是靠堆训练量,反而比主流 QAT 省。1.58-bit 把 0.6B 模型塞进 0.19 GB、解码快 15 倍,意味着真能在手机级内存里跑起来的小模型又近了一步。

要泼盆冷水:这是渐进式的工程整合,三个模块(混合精度、自适应蒸馏、熵自适应 KL)单看都不算全新概念。贡献在于针对 QAD 的三个失败模式重新设计、并拼成一个在超低 bit 下稳定可用的框架。突破性不在单点,在于这条路被走通了。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读