β-OPSD显著提升Qwen3推理性能,消融实验揭示关键机制
实验表明,β-OPSD 方法显著提升了小模型的推理能力。在 Qwen3-1.7B 上,该方法将 AIME 2024 的平均分从 vanilla OPSD 的 44.2 提升至 53.3,增幅达 9.16 分。消融实验进一步证实,该架构包含的更平滑目标路径与面向未来的信用分配机制均不可或缺,仅替换目标路径即可在 AIME 2024 等基准上带来显著收益。
2026-08-04 ~ 2026-08-04 · 2 条相关
- β-OPSD 让 Qwen3-1.7B 的 AIME24 提升 9.16 分 — furongh · 2026-08-04
- β-OPSD 消融显示目标路径和 return-to-go 都关键 — furongh · 2026-08-04