SPSD:把 MuZero 自博弈搜索蒸馏成 LLM 推理链,数学成绩 24.1→36.6

PMinervini · x · 2026-09-29

研究者提出 Self-Play Search Distillation(SPSD),探索棋盘游戏上的自博弈能否教会 LLM 推理:

所属事件:爱丁堡团队提出SPSD:棋盘自博弈蒸馏提升LLM数学推理(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →