KAIST 在线反向蒸馏实现弱监督下的强泛化

kaist-ai · hf · 2026-09-09

KAIST AI 团队提出 On-Policy Reverse Distillation,一种弱到强泛化(weak-to-strong generalization)方法。

核心机制:

为超监督(superalignment)方向提供了新的训练技术。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →