自监督新法 OPSA 无需蒸馏,AIME24 提升 35 分

heghbalz · x · 2026-09-01

新研究质疑标准策略蒸馏的有效性,认为收益主要来自抑制低概率 token 而非教师知识。研究者提出 OPSA (On-Policy Self-Adaptation),这是一种无需教师模型的方法,通过利用自熵为低概率 token 分配自适应负优势来实现自我改进。该方法在 AIME24 基准测试中将成绩提升了 35 分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →