量化到底丢了什么?用 Qwen 27B 逐级实测 BF16 到 Q2 的损失
TheMoonMidas · x · 2026-09-09
原帖(@nettermina)好奇量化宣传的「几乎无损」里「几乎」到底是什么:模型用 BF16 训练、以 Q8 发布、大家常跑 Q4,那从 BF16 一路压到 Q2 究竟丢了什么?
作者设计了一个可视化实验:让 Qwen 3 32B(BF16)写一段话,再让每个量化等级(Q8 到 Q2)各自生成同样内容,逐词标记差异。核心发现是:模型输出每个词时都带有置信度,BF16 模型有 90% 把握的词,即使量化到 Q2 也几乎不变;而只有 4050% 把握的词(即本来就有多个合理候选的词,如「windy/sunny/cloudy」)正是量化最容易破坏的部分。
「研究」频道最新
- WaveNet 十周年:扩散卷积仍遍布编解码器,语音生成范式源自此文 — heiga_zen · 2026-09-09
- OpenAI 流体力学声明引争议,NYU 教授 Buckmaster 提出替代解读 — JitendraMalikCV · 2026-09-09
- 理论数学研究的妙处:看似无关领域都通向矩阵乘法 — burny_tech · 2026-09-09
- arXiv 论文:用抽象平均推广 Jensen-Shannon 散度获闭式解 — FrnkNlsn · 2026-09-09
- AI 智能体发现「时间差」:自我牺牲加速为群体传情报 — thlarsen · 2026-09-09
- 研究:Azure PII 删除工具无法保护 MedQA 中 74% 信息 — niloofar_mire · 2026-09-09