微软研究院:弱模型也能蒸馏出更强学生模型
MicrosoftResearch · hf · 2026-08-04
微软研究院提出 Weak-to-Strong On-Policy Distillation(W2S-OPD),试图解决“没有更强 teacher 时,如何继续提升强学生模型”的问题。
- 方法核心是在 logit 空间 用一对正/负模型构造 proxy teacher,两者都比学生更小、更便宜。
- 学生在自己的 rollout 上,通过最小化 逐 token reverse KL 来蒸馏这个 proxy teacher。
- 论文设计了三类对照:RL 后模型 vs RL 前初始化、更大 base vs 更小 base、以及 正确提示 vs 错误提示。
- 在 4 个数学 和 3 个代码 基准上,W2S-OPD 都优于常规 OPD,甚至能让学生超过原本的领域 teacher;即使监督信号都更弱,方法仍然能持续带来提升。
- 分析还显示,不同对照会提供不同信号:有的更偏 推理框架,有的更偏 求解流程。
「研究」频道最新
- 伯克利论文用 CLIFT 将 Gemini 机器人变成人形专家 — berkeley_ai · 2026-08-04
- LLM 评测研究显示,提示词微调就能翻转排行榜 — jindong_wang92 · 2026-08-04
- 每个 Agent 都需要的电脑与浏览器验证技能 — vikvang1 · 2026-08-04
- 密歇根大学实验室招 5 个 AI、ECG 与多组学岗位 — kevinnbass · 2026-08-04
- scE2G 预测已覆盖数百种细胞类型可在线浏览 — anshulkundaje · 2026-08-04
- scE2G 登上 Nature Genetics 并补充 CRISPR 基准 — anshulkundaje · 2026-08-04