新论文 SPSD:用棋盘游戏自博弈搜索蒸馏出超人类思维链,数学均分 24.1 提至 36.6
PMinervini · x · 2026-09-29
爱丁堡大学 Pasquale Minervini 团队发布 arXiv 论文《Self-Play Search Distillation for LLM Reasoning》,提出用 MuZero 类网络在棋盘游戏上自博弈,把搜索记录转化为「超人类」思维链来训练 LLM 推理:
- 方法:利用可执行环境把搜索过程变成结构化推理问题,每一步由专家标注首选决策、备选方案、对手回应与价值估计,再蒸馏成有环境依据的监督数据,绕开合成数据质量低与人工标注贵的瓶颈。
- 结果:在 Qwen3-4B-Base 上,六个数学基准平均分从 24.1 提升至 36.6;留出棋局的胜率从 15% 升至 45%,说明能力可迁移到未见过的数学任务。
- 意义:作者称大规模自博弈合成环境可能成为无限的超人类后训练数据来源。研究为第一作者 Lorenzo Molfetta 在爱丁堡访问期间与 UniboNLP 合作完成。
所属事件:爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理(2 条相关)→
「研究」频道最新
- PhyMotion 入选 NeurIPS:3D 物理奖励让 1.3B 视频模型追平 14B — mohitban47 · 2026-09-29
- Ben Goertzel 提出新方向:向开源 Transformer 混入符号程序学习 — bengoertzel · 2026-09-29
- 6 个可视化 AI 学习资源:从 Transformer 到扩散模型都能拆开看 — techNmak · 2026-09-29
- 18 万条工具调用决策数据集开源,可训练小模型替代 LLM 做路由 — MaziyarPanahi · 2026-09-29
- Pruned CTC 内存降5.1倍,让LLM词表直接做语音识别 — X-LANCE · 2026-09-29
- SCOPD:剪枝仅留10%视觉token,VLM仍保92%性能 — uoft · 2026-09-29