研究揭示 LLM 蒸馏:同源弱师胜过异源强师
rohanpaul_ai · x · 2026-08-30
这项关于 LLM 在线策略蒸馏(OPD)的研究揭示了一个反直觉现象:学生模型主要复制教师模型的推理行为而非具体答案。
核心发现:
- 师承关系重于分数:与基座模型同源的弱教师模型,往往比不同族的强教师模型能带学生走得更远。
- 数据次要性:训练数据的难度几乎不影响泛化效果,即使教师未解决的题目也有用。
- 泛化的双刃剑:同源蒸馏能跨语言、跨领域迁移能力;但混合多源教师会导致能力间的“跷跷板”效应,难以精准控制各教师的影响范围。
所属事件:研究称策略蒸馏传递推理行为 同源弱师胜异源强师(3 条相关)→
「研究」频道最新
- 强模型给弱模型搭脚手架:不训练小模型,准确率近乎翻倍 — 机器之心 · 2026-08-30
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30