GoBench:用围棋评估 LLM 推理,与 ARC-AGI 2 相关性达 0.83
Roland31415 · reddit · 2026-09-17
Roland31415 发布 GoBench,让 LLM 在 9x9 围棋上对阵从随机到超人级的 KataGo 对手阶梯,以衡量通用推理能力:
- 基准与 ARC-AGI 2 成绩强相关(r=0.83),且远未饱和
- GPT-6 Astra max 达约 2500 Elo,远低于最强 KataGo 的 4400 Elo
- 配合编码工具并在赛前准备两小时后,Codex with Astra 可达 3560 Elo,显示工具调用对推理短板的弥补
排行榜、代码与论文均已公开,作者承诺持续更新榜单。
所属事件:GoBench发布:用围棋测LLM通用推理(2 条相关)→
「模型」频道最新
- 用户半小时连用 4 次 Codex banked resets 重置 5 小时限额 — flowersslop · 2026-09-17
- 神秘模型 Union Alpha 登场:DeepSWE 得分 74%,超越 GPT-5.6 Sol 且更便宜 — ZeroStateReflex · 2026-09-17
- $200 Pro 用户频繁触发图像限速弹窗,点掉仍能生成 — Jello_Hello_Fellos · 2026-09-17
- 自建 GoBench:GPT-6 Astra 下棋达 2568 Elo 领跑 — Roland31415 · 2026-09-17
- GPT-6 Astra 直播中首夺《杀戮尖塔 2》A10 胜利,用恶魔形态卡组 — Jsevillamol · 2026-09-17
- 演讲者还在调侃 ChatGPT 幻觉,作者反问:你配上下文和深度研究了吗? — zebird0 · 2026-09-17