β-OPSD 让 Qwen3-1.7B 的 AIME24 提升 9.16 分
furongh · x · 2026-08-04
- 在 Qwen3-1.7B 上,β-OPSD 把 AIME 2024 avg@12 从 vanilla OPSD 的 44.2 提升到 53.3,提升 9.16 分。
- 在 AIME 2024 / AIME 2025 / HMMT 2025 三个基准上,方法相对 vanilla OPSD 的平均提升为 +5.74 分,并且平均成绩超过 GRPO。
- 这页还展示了不同模型规模下都能受益:Qwen3-8B、Qwen3-4B、Qwen3-1.7B 均比 vanilla OPSD 更好。
所属事件:β-OPSD显著提升Qwen3推理性能,消融实验揭示关键机制(2 条相关)→
「研究」频道最新
- Sakana AI 启动 RSI Lab,押注递归自我改进研究 — SakanaAILabs · 2026-08-04
- Sakana AI 加入日本 AI 机器人协会,推进世界模型与物理 AI — SakanaAILabs · 2026-08-04
- 经济学研究里验证 AI 生成代码的三步清单 — Afinetheorem · 2026-08-04
- 一段多模态论文比较被指只是在复述领域常识 — YouJiacheng · 2026-08-04
- エイトノット将携船舶自律航行系统亮相 ROSCon JP 2026 — 4310sy · 2026-08-04
- VAD 让多模态蒸馏只学视觉证据,六项基准优于直接监督 — Kangning Zhang · 2026-08-04