商业 LLM 预训练再多,为什么下棋还是不行
alex_peys · x · 2026-07-29
作者认为 国际象棋仍然是检验 LLM 的一个好 benchmark,因为商业模型即使在预训练里见过大量棋谱、棋书,实战表现还是很差。
他抛出的关键问题是:
- 如果模型里已经有这么多棋类材料,为什么还是下不好棋?
- 直接用 SFT / RL 针对棋类训练,当然能让模型变得比人更强
- 但有没有办法在 不靠暴力式任务奖励或模仿学习 的情况下,把这种能力“提取”出来?
这条更像是在讨论预训练里到底存了什么能力,以及这些能力能否被更优雅地唤醒。
所属事件:商业LLM国际象棋表现不佳揭示能力涌现瓶颈(2 条相关)→
「研究」频道最新
- cnsplots 用少量代码生成论文级科研图表 — KevinKaichuang · 2026-07-29
- PostTrainBench v1.1 揪出 234 个污染跑分并重排榜单 — karinanguyen · 2026-07-29
- 混合人机评测流程图:LLM judges 至少 15 标签、IRR 约 0.40 — IanArawjo · 2026-07-29
- AI 研究正从单卡 3090 跳到 NVL72 级集群 — _xjdr · 2026-07-29
- GenomeLayer 称基因组智能体已能迭代设计目标 DNA 序列 — julia_kiseleva · 2026-07-29
- Natolambert 讲 RL 正则化:KL 约束与泛化优势 — natolambert · 2026-07-29