无需监督信号,新自蒸馏方法让 LLM 自我纠错能力提升

burny_tech · x · 2026-08-08

传统的大语言模型自蒸馏方法往往仍需依赖标准答案、验证器奖励或更强的教师模型。一篇名为《On-Policy Self-Distillation without Any Supervision》的论文提出了一种完全自监督的新方法。

其核心机制为:

这种方法无需任何标签即可提供密集的策略内修正。实验表明,在 Qwen3 数学任务的非思考模式下,该方法相比有监督的 OPSD 和 GRPO 分别提升了 3.2 和 8.9 个百分点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →