GoBench发布:用围棋测LLM通用推理
Reddit 用户 Roland31415 发布自建基准 GoBench,让 LLM 在 9x9 围棋上对阵从随机到超人级的 KataGo 对手阶梯,以衡量通用推理能力。该基准与 ARC-AGI 2 的相关性高达 0.83。结果显示 GPT-6 Astra 下棋表现最强,达到 2568 Elo 领跑各模型。
2026-09-17 ~ 2026-09-17 · 2 条相关
- GoBench:用围棋评估 LLM 推理,与 ARC-AGI 2 相关性达 0.83 — Roland31415 · 2026-09-17
- 自建 GoBench:GPT-6 Astra 下棋达 2568 Elo 领跑 — Roland31415 · 2026-09-17