论文提出弱到强蒸馏新法:Qwen3-8B数学代码能力反超教师模型

burny_tech · x · 2026-07-31

一篇名为《Weak-to-Strong On-Policy Distillation》的论文提出了一种新的模型蒸馏方法。

通常强模型需要更强的教师模型进行OPD(在策略蒸馏),但前沿模型的强教师难以获取。该论文指出,可以通过提取“弱正向模型”与“更弱负向模型”之间的logit方向差异来提升强模型,而不是单纯复制某一个。实验表明,使用该方法训练的 Qwen3-8B 在数学和代码能力上得到显著提升,有时甚至超越了它所学习的4B RL教师模型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →