研究揭示 LLM 蒸馏:同源弱师胜过异源强师

rohanpaul_ai · x · 2026-08-30

这项关于 LLM 在线策略蒸馏(OPD)的研究揭示了一个反直觉现象:学生模型主要复制教师模型的推理行为而非具体答案。

核心发现:

所属事件:研究称策略蒸馏传递推理行为 同源弱师胜异源强师(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →