爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理
爱丁堡大学 Pasquale Minervini 团队发布 arXiv 论文《Self-Play Search Distillation for LLM Reasoning》,提出 SPSD 方法,先在棋盘游戏上通过 MuZero 式自博弈训练搜索,再将其蒸馏成 LLM 的推理思维链。实验显示,该方法使模型数学平均分从 24.1 提升至 36.6,证明自博弈搜索可教会 LLM 产生超人类水平的推理链。
2026-09-29 ~ 2026-09-29 · 2 条相关
- SPSD:把 MuZero 自博弈搜索蒸馏成 LLM 推理链,数学成绩 24.1→36.6 — PMinervini · 2026-09-29
- 新论文 SPSD:用棋盘游戏自博弈搜索蒸馏出超人类思维链,数学均分 24.1 提至 36.6 — PMinervini · 2026-09-29