推理模型训练无需强教师,低概率token更新更关键

burkov · x · 2026-09-02

研究表明,利用强模型打分的训练方式反馈存在噪声,但学生模型仍能提升。核心机制在于训练主要改变了模型自身认为不太可能的 token。基于此提出的 On-Policy Self-Adaptation (OPSA) 方法仅更新低概率 token,并在模型不确定处加强更新,无需教师即可复现大部分收益。

所属事件:研究称同策略蒸馏靠抑制低概率token而非教师(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →