商业大模型下棋表现不佳,推理能力成关键

国际象棋正成为检验大语言模型(LLM)能力边界的重要基准。尽管商业模型在预训练中可能见过大量棋谱,但实战表现依然很差。一项棋类LLM训练实验表明,仅用“棋盘状态到落子”的监督学习收益有限;而在训练数据中混入约8%的“先思考再下棋”推理轨迹后,尽管模型会产生幻觉,其Elo等级分仍迅速冲至1300分。这表明推理能力可能是突破LLM下棋瓶颈的关键。

2026-07-29 ~ 2026-07-29 · 3 条相关