OASIS 用已验证轨迹修复自蒸馏缩放失效,8B 模型 AIME 提升 3 分以上
Md. Ismail Hossain · hf · 2026-10-01
这项研究分析并修复了在线策略自蒸馏(OPSD)随模型规模增大而失效的问题。
诊断: 因子分解分析发现,scaffold(学生轨迹)的正确性比 teacher 上下文(参考解答)的正确性对下游精度影响更大。未验证的 scaffold 造成「模仿鸿沟」——teacher 能用学生拿不到的信息;该鸿沟随模型规模缩小,但 OPSD 仍在监督大量未验证轨迹,导致其增益从 1.7B 的 3.05 分跌到 8B 的 0.14 分。
方法(OASIS): 保留 OPSD 目标,但主要监督经标签验证的在线策略轨迹,并把书面参考解答替换为未验证的模型自生成尝试作为 teacher 上下文——只需最终答案标签即可训练。
结果: 在 Qwen3-1.7B/4B/8B 上,针对 AIME 2024、AIME 2025、HMMT 2025,OASIS 较基线平均提升 3.2–3.8 分;8B 规模下比 OPSD 高 3.05 分,证明经验证的在线策略 scaffold 能让自蒸馏随规模保持有效。
「研究」频道最新
- Google 研究:教师用生成式 UI 自建教学模拟,教师评分 8/10 — dl_weekly · 2026-10-01
- 每次不到 1 美分,事后核查可抓住 61% 谎报完成的 AI Agent — alex_verem · 2026-10-01
- 从 GPU 显存瓶颈下手,Tri Dao 的 FlashAttention 如何成为大模型标配 — thisdudelikesAI · 2026-10-01
- Looped Transformer 深度复盘:复用层多算几轮,哪些任务才值得? — ArchitectingAI · 2026-10-01
- ID Balancing 用 PID 控制论稳定 256 倍稀疏 MoE 训练 — teortaxesTex · 2026-10-01
- AI-Newton 从噪声实验数据独立推导出 F=ma 与万有引力 — CurieuxExplorer · 2026-10-01