混入 8% 推理轨迹后,棋类 LLM 冲到 1300 Elo
amasad · x · 2026-07-29
一个棋类 LLM 训练实验发现,只用“棋盘状态 → 落子”配对监督会很快遇到明显的收益递减。训练中一次意外生成了“先思考再下棋”的分支,虽然这条分支会幻觉出错误走法,但把大约 8% 这类推理轨迹混入普通训练后,在相同预算下反而超过了纯落子数据。
- 这套模型最终达到了 1300 Elo。
- 纯 board→move 数据很快进入瓶颈。
- 少量有瑕疵的推理轨迹,帮助模型内化“思考过程”,而不需要在推理时真的显式展开。
所属事件:商业大模型下棋表现不佳,推理能力成关键(3 条相关)→
「研究」频道最新
- 行为经济学新研究:AI 参与会瓦解人类合作的社会规范 — steverathje2 · 2026-07-30
- 攻克博士半年难题:GPT-5.6 Pro 成功证明复杂数学不等式 — thomasahle · 2026-07-30
- NBER 讲座探讨:AI 生成数据将颠覆经济学实证研究 — TaniaBabina · 2026-07-30
- LessWrong 深度长文:用 RL 与搜索构建 AGI 为何令人恐惧 — DKokotajlo · 2026-07-30
- 实时可控视频世界模型 Wonder:16FPS生成长视频 — qixing_huang · 2026-07-30
- 工程师驳斥Kimi K3内存论:小状态不代表能闪存卸载 — AccBalanced · 2026-07-30