多教师在线蒸馏的梯度剖析:Adam 与 BF16 如何抹平教师信号差异
UIUC-CS · hf · 2026-10-06
以 Qwen3-1.7B 和四个同初始化 RL 训练的领域教师为对象,剖析教师信号如何影响参数更新,并有 SmolLM3-3B 交叉验证:
- 损失平均隐式加权响应:token 平均偏好更长响应,均衡领域贡献后域内仍保留该加权
- Adam 一阶矩抹平参数更新差异:教师间余弦相似度 0.83,平均规则间达 0.96,尽管原始梯度差异明显
- BF16 舍入掩盖微小变化:约 97% 的 FP32 主权重相对初始化有变化,但 BF16 权重只有 7–11%
- top-64 交集 KL 梯度 closely 匹配全词表梯度,但对任务效果取决于平均方式:响应平均下数学准确率比 sampled-token PG 高 2.6 分,全局 token 平均下反而低 2.1 分
「研究」频道最新
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess免训练缓解全模态幻觉,附3,540例新基准 — Huiqiang Rong · 2026-10-06
- ADSD框架让AI自诊数值求解器,误差降低近71倍 — Peter Chen · 2026-10-06
- ACG-Bench测双臂VLA组合泛化,AE-VLA把成功率从3%拉到21.5% — Zaibin Zhang · 2026-10-06