商业大模型下棋表现不佳,推理能力成关键
国际象棋正成为检验大语言模型(LLM)能力边界的重要基准。尽管商业模型在预训练中可能见过大量棋谱,但实战表现依然很差。一项棋类LLM训练实验表明,仅用“棋盘状态到落子”的监督学习收益有限;而在训练数据中混入约8%的“先思考再下棋”推理轨迹后,尽管模型会产生幻觉,其Elo等级分仍迅速冲至1300分。这表明推理能力可能是突破LLM下棋瓶颈的关键。
2026-07-29 ~ 2026-07-29 · 3 条相关
- 商业 LLM 预训练再多,为什么下棋还是不行 — alex_peys · 2026-07-29
- LLM 为何仍下不好棋,可能是能力涌现的一道关键题 — alex_peys · 2026-07-29
- 混入 8% 推理轨迹后,棋类 LLM 冲到 1300 Elo — amasad · 2026-07-29