爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理

爱丁堡大学 Pasquale Minervini 团队发布 arXiv 论文《Self-Play Search Distillation for LLM Reasoning》,提出 SPSD 方法,先在棋盘游戏上通过 MuZero 式自博弈训练搜索,再将其蒸馏成 LLM 的推理思维链。实验显示,该方法使模型数学平均分从 24.1 提升至 36.6,证明自博弈搜索可教会 LLM 产生超人类水平的推理链。

2026-09-29 ~ 2026-09-29 · 2 条相关