Gary Marcus 用 ChessBench 反驳大模型棋力神话
GaryMarcus · x · 2026-07-29
Gary Marcus 直接拿下棋能力反击“模型已经比最聪明的人还聪明”的说法。
他引用 @Kasparov63 的峰值等级分 2851,认为加里·卡斯帕罗夫甚至在 7 岁时,可能都能击败最强的商业 LLM。帖子还提到新的 ChessBench,用 coherence、accuracy 和 Elo 等维度来展示不同模型在棋类任务上的表现。
这条帖子的重点不是“某个模型赢了”,而是借棋类基准强调:即使 AGI 叙事很热,语言模型距离真正稳健的博弈能力仍然很远。
「模型」频道最新
- Kimi K3 成首个通过 Compound 内部基准的开源模型 — peterjliu · 2026-07-29
- Claude Opus 5 登顶 LisanBench,medium 模式更省 token — scaling01 · 2026-07-29
- Bindu Reddy 称 OpenAI 与 Anthropic 在 Kimi K3 上制造恐慌 — bindureddy · 2026-07-29
- Claude 泄露 CoT 被玩成 Anthropic 模型梗图 — OwariDa · 2026-07-29
- Reddit 讨论称 Qwen 可能已难复现 3.6 级别的紧凑质量 — Leflakk · 2026-07-29
- 阿里 Qwen 启动 QwenGrowthPlan 收集 Qwen3.8 真实任务反馈 — pmttyji · 2026-07-29