HF论文导读:在策略蒸馏法,极低算力实现弱到强泛化

Hugging Face · youtube · 2026-08-12

Hugging Face 研究团队在其 Journal Club 栏目中探讨了论文《Weak-to-Strong Generalization via Direct On-Policy Distillation》。

该研究提出了一种极具性价比的方法,能将强化学习(RL)在小模型上获得的收益迁移到更大的模型中。它并非直接让大模型去模仿小模型,而是测量 RL 改变了小模型策略的哪些部分,并将这种变化作为密集的奖励信号来训练大模型。

实验表明,这种弱到强的泛化方式,能够以极低的计算成本,在大模型上达到甚至超越直接进行 RL 训练的效果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →