Adobe 提出输出头 Softmax 重参数化,W4 量化后 KL 误差降 73%
adobe · hf · 2026-09-28
Adobe 研究团队提出一种后训练量化方法:softmax 重参数化,用于大幅降低小模型输出头的量化损失。
- 原理:大词表使输出头在小语言模型推理成本中占比很高。方法在量化前从每个输出行减去词表行均值的标量倍数,选出一个功能等价的输出头;系数通过对 RTN、activation-weighted MSE、full-Hessian GPTQ 三种量化器分别做验证 KL 的一维搜索确定。
- 优点:保留全精度 softmax 分布、不动训练好的 decoder,rank-one 校正可处理 soft-capping 等非线性 logit 路径。
- 效果:七个输出头上,W4 增益集中在基线量化失真大的场景——Phi-4-mini 上 AW-MSE KL 从 0.936 降到 0.256;增益与 per-channel scaling、affine 量化互补;WikiText 上选的冻结系数可迁移到 C4 和 OpenWebMath,18 项对比全面优于均值中心化。
- 推理收益:shift 兼容的输出头不增加推理操作;BF16 decoder 下,量化 Phi 输出头使 batch-one 生成延迟降低 10.8%。W2 压力测试下收益进一步扩大。
「研究」频道最新
- Schmidhuber 2008 年论文:好奇心即压缩进度算法 — anselm · 2026-09-28
- LLM 是随机鹦鹉吗?博主重提形式与意义经典论文 — lambdaviking · 2026-09-28
- 学生团队复盘安全事件响应 agent Aegis:记忆是设计决策而非开关 — pranitha95 · 2026-09-28
- 测试 AI 材料推荐时,故意合成一个预测表现差的材料 — bravo_abad · 2026-09-28
- Tau Robotics Delta-0:人形机器人开始自己生成训练经验数据 — CyberRobooo · 2026-09-28
- gnomAD MCP 服务器发布:统一查询三大版本基因变异数据库 — modelcontextprotocol · 2026-09-28