混入 8% 推理轨迹后,棋类 LLM 冲到 1300 Elo

amasad · x · 2026-07-29

一个棋类 LLM 训练实验发现,只用“棋盘状态 → 落子”配对监督会很快遇到明显的收益递减。训练中一次意外生成了“先思考再下棋”的分支,虽然这条分支会幻觉出错误走法,但把大约 8% 这类推理轨迹混入普通训练后,在相同预算下反而超过了纯落子数据。

所属事件:商业大模型下棋表现不佳,推理能力成关键(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →