新论文提出 OPRD:在线反向蒸馏实现弱到强泛化
KAIST AI 团队在 arXiv 发表论文《Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation》,提出 OPRD 方法:通过弱教师反向蒸馏,让强学生模型在弱监督下超越教师上限,实现弱到强泛化,为利用弱监督训练出更强的模型提供了新路径。
2026-09-09 ~ 2026-09-10 · 2 条相关
- KAIST 在线反向蒸馏实现弱监督下的强泛化 — kaist-ai · 2026-09-09
- 新论文提出 OPRD:弱教师反向蒸馏让学生模型超越教师上限 — algo_diver · 2026-09-10