OASIS 用已验证轨迹修复自蒸馏缩放失效,8B 模型 AIME 提升 3 分以上

Md. Ismail Hossain · hf · 2026-10-01

这项研究分析并修复了在线策略自蒸馏(OPSD)随模型规模增大而失效的问题。

诊断: 因子分解分析发现,scaffold(学生轨迹)的正确性比 teacher 上下文(参考解答)的正确性对下游精度影响更大。未验证的 scaffold 造成「模仿鸿沟」——teacher 能用学生拿不到的信息;该鸿沟随模型规模缩小,但 OPSD 仍在监督大量未验证轨迹,导致其增益从 1.7B 的 3.05 分跌到 8B 的 0.14 分。

方法(OASIS): 保留 OPSD 目标,但主要监督经标签验证的在线策略轨迹,并把书面参考解答替换为未验证的模型自生成尝试作为 teacher 上下文——只需最终答案标签即可训练。

结果: 在 Qwen3-1.7B/4B/8B 上,针对 AIME 2024、AIME 2025、HMMT 2025,OASIS 较基线平均提升 3.2–3.8 分;8B 规模下比 OPSD 高 3.05 分,证明经验证的在线策略 scaffold 能让自蒸馏随规模保持有效。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →