Latent-MOPD:表征级多教师在线蒸馏,单一学生超越每位教师
zillow · hf · 2026-10-06
提出首个表示层(representation-level)的多教师在线蒸馏方法 Latent-MOPD:在 token 预测之外,还通过教师模型的隐状态(hidden states)向学生传递知识,无需额外训练教师。
- 通过按师生关系选取后层目标、共享投影对齐不同隐层宽度、按领域分组更新来协调多教师的表示监督,监督随训练从隐状态逐渐过渡到 token 预测
- 同族设定下,在数学、代码、逻辑共九个基准上全面超过仅 token、仅表示、均匀平均三种基线;与每位教师参数量相同的学生,在多数基准上超过逐基准最优教师
- 使用更大的跨族教师时,也在全部基准上优于单通道基线
- 消融发现全层表示监督在领域纯净更新下稳定,混合领域更新则会崩溃
「研究」频道最新
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess免训练缓解全模态幻觉,附3,540例新基准 — Huiqiang Rong · 2026-10-06
- ADSD框架让AI自诊数值求解器,误差降低近71倍 — Peter Chen · 2026-10-06
- ACG-Bench测双臂VLA组合泛化,AE-VLA把成功率从3%拉到21.5% — Zaibin Zhang · 2026-10-06