NTU 提出 DN-MOPD:按域归一化反馈强度修复多教师蒸馏失衡
NanyangTechnologicalUniversity · hf · 2026-09-29
南洋理工大学研究多教师 on-policy 蒸馏(MOPD):让 RL 训出的多个单技能专家共同教一个学生。发现问题在于各域反馈强度失衡——instruction-following 反馈的分布宽度是数学的数倍,主导了学生更新,导致学生学不到数学专家的优势。
- 提出 Domain-Normalized MOPD:保留路由,按实测分布宽度重新缩放各域反馈
- 在三个尺寸的 Qwen3.5 模型、六个公开 benchmark、三个随机种子和两种答案长度限制下,DN-MOPD 均优于 MOPD,并恢复了大部分损失的数学增益
- 控制实验表明增益主要来自调低 instruction-following 反馈,且接近实测值的固定权重效果相当
结论:合并多个专家不仅要决定谁教,还要决定其反馈的强度。
「研究」频道最新
- ColNanoVDR 免文档蒸馏多向量检索,149M 小模型保住 95% 检索精度 — nanovdr · 2026-09-29
- 重设计 DiT 残差连接:训练迭代减少 1.73 倍,FID 降至 1.39 — NationalUniversityofSingapore · 2026-09-29
- Imprint Reader:让模型用自然语言解读自身权重更新 — Guanxu Chen · 2026-09-29
- 上交大 GeoVerse:在几何潜空间合成世界一致的新视角 — SJTU · 2026-09-29
- 腾讯混元给出无编码器多模态预训练 Scaling Law:10^22 FLOPs 处反超 — Tencent-Hunyuan · 2026-09-29
- 表征工程何时有用?LLM 安全控制与监控的公平对决 — Tianyi Guan · 2026-09-29