SPSD:把 MuZero 自博弈搜索蒸馏成 LLM 推理链,数学成绩 24.1→36.6
PMinervini · x · 2026-09-29
研究者提出 Self-Play Search Distillation(SPSD),探索棋盘游戏上的自博弈能否教会 LLM 推理:
- 方法:先在棋盘游戏上用自博弈训练 MuZero 专家,再把其搜索过程蒸馏成推理轨迹,用于微调 LLM。
- 结果:推理能力可迁移到未见过的游戏,并能泛化到数学任务,成绩从 24.1 提升到 36.6。
- 意义:展示经典搜索型强化学习的规划能力可以作为推理监督信号,绕开纯文本蒸馏的局限。
所属事件:爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理(2 条相关)→
「研究」频道最新
- 6 个可视化 AI 学习资源:从 Transformer 到扩散模型都能拆开看 — techNmak · 2026-09-29
- 18 万条工具调用决策数据集开源,可训练小模型替代 LLM 做路由 — MaziyarPanahi · 2026-09-29
- Pruned CTC 内存降5.1倍,让LLM词表直接做语音识别 — X-LANCE · 2026-09-29
- SCOPD:剪枝仅留10%视觉token,VLM仍保92%性能 — uoft · 2026-09-29
- AnswerMap:免训练黑盒方法让VLM空间解释AUC达0.85 — Mohamed Eltahir · 2026-09-29
- 学者称「AI 署名」定义模糊,学术会议分流政策一两年内将失效 — ipeirotis · 2026-09-29