LLM 为何仍下不好棋,可能是能力涌现的一道关键题
alex_peys · x · 2026-07-29
帖子认为,象棋仍然是观察 LLM 能力边界的好任务。
- 尽管商业 LLM 很可能在预训练里见过大量棋谱和棋书,但它们下棋仍然很弱。
- 作者指出,如果直接针对棋类做 SFT / RL,模型显然会强很多;甚至很小的网络经过很短训练也能达到很高水平。
- 真正的问题是:能不能不依赖任务特化的可验证奖励或行为克隆,直接把这种能力“提取”出来。
所属事件:商业大模型下棋表现不佳,推理能力成关键(3 条相关)→
「研究」频道最新
- 讨论:为何没人开发神经网络检测AI文本?图像已有研究 — emeka_boris · 2026-07-30
- Agent做数学研究仍困难:代码生成陷入证书和库存 — doodlestein · 2026-07-30
- TorchSpec 实现大规模分离式推测解码训练,已被腾讯混元等采用 — zhyncs42 · 2026-07-30
- 算力狂飙:2028 年 AI 将解锁的十大科技突破 — Annual_Judge_7272 · 2026-07-30
- 揭秘 SOTA 深度研究架构:模型原生训练与 150 个子智能体 — SimonShaoleiDu · 2026-07-30
- 普林斯顿教授评 MIT 非凸优化新论文:未达悬赏要求 — HazanPrinceton · 2026-07-30