新论文 SPSD:用棋盘游戏自博弈搜索蒸馏出超人类思维链,数学均分 24.1 提至 36.6

PMinervini · x · 2026-09-29

爱丁堡大学 Pasquale Minervini 团队发布 arXiv 论文《Self-Play Search Distillation for LLM Reasoning》,提出用 MuZero 类网络在棋盘游戏上自博弈,把搜索记录转化为「超人类」思维链来训练 LLM 推理:

所属事件:爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →