商业 LLM 预训练再多,为什么下棋还是不行

alex_peys · x · 2026-07-29

作者认为 国际象棋仍然是检验 LLM 的一个好 benchmark,因为商业模型即使在预训练里见过大量棋谱、棋书,实战表现还是很差。

他抛出的关键问题是:

这条更像是在讨论预训练里到底存了什么能力,以及这些能力能否被更优雅地唤醒。

所属事件:商业LLM国际象棋表现不佳揭示能力涌现瓶颈(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →