实测发现 FFN 精度决定量化损耗,Qwen 微调模型实现极限压缩
enginetown · reddit · 2026-07-31
开发者对 Qwen3.6-27B-Fable-Fusion-711 模型进行了全组件组合 KLD 量化测试。与上次单独测试各权重组不同,本次构建了完整的量化模型并进行了真实测试与多轮修复。
关键发现:
- 抗压缩能力更强:该微调模型比基础版 Qwen3.6-27B 容忍更激进的压缩,且不同组件差异极大。部分注意力层和状态层(如 attnq, ssmbeta 等)在极限压缩下几乎无损,而基础版在更早阶段就出现退化。
- 工具调用更稳定:以往量化中工具调用通常最先受损,但本次测试中通用文本输出率先退化,工具调用反而保持了较好的稳定性。
- FFN 精度是核心瓶颈:最反直觉的发现是,只要保护好看前馈网络(FFN)的精度,大幅削减注意力层带来的体积代价极小。真正的质量损耗几乎全来自于 FFN 精度下降。
作者最终输出了三个不同压缩级别的版本(3.90 到 3.33 BPW),所有测试类别的 KLD 散度均未越过红线,并坦诚列出了目前尚未覆盖的测试盲区(如数学和工具调用的极限压力测试),将最终风险评估交还给具体使用场景。
「研究」频道最新
- WaveSight:利用毫米波等无线电波实现非可见光透视与 3D 重建 — ctjlewis · 2026-07-31
- 探讨用状态向量表达 LLM 情绪:上下文压力等同疲劳感 — Dependent-Advance468 · 2026-07-31
- 开源智能体实战复盘:如何根除“零改动”伪成功与无效死循环 — Federal-Teaching2800 · 2026-07-31
- Living-Harness:让智能体 harness 进化,失败经验转为可复用记忆 — burny_tech · 2026-07-31
- AI制药动态:Relation与GSK达成最高1.1亿美元合作 — anshulkundaje · 2026-07-31
- 斯坦福 CS229 机器学习 2026 春季课程视频上线 — caglar_ee · 2026-07-31