论文提出弱到强蒸馏新法:Qwen3-8B数学代码能力反超教师模型
burny_tech · x · 2026-07-31
一篇名为《Weak-to-Strong On-Policy Distillation》的论文提出了一种新的模型蒸馏方法。
通常强模型需要更强的教师模型进行OPD(在策略蒸馏),但前沿模型的强教师难以获取。该论文指出,可以通过提取“弱正向模型”与“更弱负向模型”之间的logit方向差异来提升强模型,而不是单纯复制某一个。实验表明,使用该方法训练的 Qwen3-8B 在数学和代码能力上得到显著提升,有时甚至超越了它所学习的4B RL教师模型。
「研究」频道最新
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- 伯克利峰会探讨:走向自我改进的智能体系统 — furongh · 2026-07-31
- NeurIPS 2026 将在悉尼举办 AI for Science 研讨会 — MarioKrenn6240 · 2026-07-31
- 强化学习的价值:解决可学习但不可教授的问题 — sytelus · 2026-07-31
- AdaMAST:用失败分类法提升AI代理表现 — abeirami · 2026-07-31
- Kimi K3 论文硬核系统工程:自研编译器与芯片设计 — DynamicWebPaige · 2026-07-31