KAIST 在线反向蒸馏实现弱监督下的强泛化
kaist-ai · hf · 2026-09-09
KAIST AI 团队提出 On-Policy Reverse Distillation,一种弱到强泛化(weak-to-strong generalization)方法。
核心机制:
- 让强模型在弱监督者下超越弱模型
- 沿教师模型的偏移方向放大验证器支持的策略梯度
- 加速优化,且不限制学生模型容量
为超监督(superalignment)方向提供了新的训练技术。
「研究」频道最新
- Mask Forcing:双噪声掩码蒸馏缓解自回归视频扩散模式坍塌 — Zhuoran Zhao · 2026-09-09
- CosmoH2G:手部演示迁移到机械夹爪的数据集与基线方法 — Hongxiang Zhao · 2026-09-09
- BeaconKV:用信标查询预测 KV 缓存复用,压缩长推理链显存 — Janghyeon Kim · 2026-09-09
- CVRR:强制潜态视觉推理走图像条件通路,验证潜空间推理必要性 — Suhyeong Park · 2026-09-09
- TANGO:全身 VLA 模型驱动人形机器人,仅用仿真数据穿越杂乱环境 — Anqi Li · 2026-09-09
- Google 提出程序化图:自进化执行结构改善 LLM 智能体长程工具调用 — google · 2026-09-09