自监督新法 OPSA 无需蒸馏,AIME24 提升 35 分
heghbalz · x · 2026-09-01
新研究质疑标准策略蒸馏的有效性,认为收益主要来自抑制低概率 token 而非教师知识。研究者提出 OPSA (On-Policy Self-Adaptation),这是一种无需教师模型的方法,通过利用自熵为低概率 token 分配自适应负优势来实现自我改进。该方法在 AIME24 基准测试中将成绩提升了 35 分。
「模型」频道最新
- 实测GLM-5.3 Flash:调试时多部分追踪能力出色 — MikePFrank · 2026-09-01
- 小模型本地运行,完美追踪 John Wick 混乱场景 — richdotca · 2026-09-01
- Qwen 3.8 27b 单次生成完整超级马里奥克隆游戏 — zannix · 2026-09-01
- 本地模型 SVG 生成实测:Qwen 3.8 表佳 — pmigdal · 2026-09-01
- Arena 排行榜现神秘 Gemma 模型,或为 Gemma 5 — Hot_Example_4456 · 2026-09-01
- antirez 演示 DeepSeek v4 Flash 视觉版在 M5 Max 上本地快速运行 — antirez · 2026-09-01