新蒸馏法「老师是方向不是终点」:学生模型可反超教师,四组模型验证
_akhaliq · x · 2026-10-02
论文《The Teacher Is a Direction, Not a Destination》提出一种新的 on-policy 蒸馏方法:通过外推 RL 诱导的表征残差(extrapolates RL-induced representation residuals),让学生模型在蒸馏时沿「教师指出的方向」继续前进,而不是止步于教师的能力上限。
关键结果:
- 在四组模型配对上,学生模型能够匹配甚至超过教师模型;
- 代码与 checkpoint 计划开源发布。
这对知识蒸馏的传统假设(学生只能逼近教师)是一个挑战,思路是用 RL 带来的表征变化方向作为外推依据。
「研究」频道最新
- Ptarmigan-1 开放:无需 3D 结构的 AI 药物发现模型免费可用 — ycombinator · 2026-10-02
- 高通团队发布 IVD 基准:VLM 实时面对面问答仍远落后人类 — rishit_dagli · 2026-10-02
- 密歇根大学:换更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M — umich · 2026-10-02
- 中科大 GraphForge:证据图锚定真实文件合成任务,2 千条轨迹显著提升 GDPVal — ustc-community · 2026-10-02
- CMU 提出预测信用协议:研究 agent 的科学解释能否带来预测增益?结果未定 — CarnegieMellonU · 2026-10-02
- FloWright 让多智能体工作流协同进化,小模型最高提升 7.41% — Xuehang Guo · 2026-10-02