Direct-OPD:弱模型 RL 经验迁移强模型

tokenbender · x · 2026-08-21

论文提出 Direct On-Policy Distillation (Direct-OPD) 方法,解决在大模型上重复运行昂贵 RL 的问题。通过在弱模型上运行 RL,然后将其诱导的策略变化(而非最终策略)作为隐式奖励信号蒸馏给强模型。实验表明,该方法能有效利用弱模型提升强模型目标的表现,如将 Qwen3-1.7B 准确率从 48.3% 提升至 58.3%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →