GoBench发布:用围棋测LLM通用推理

Reddit 用户 Roland31415 发布自建基准 GoBench,让 LLM 在 9x9 围棋上对阵从随机到超人级的 KataGo 对手阶梯,以衡量通用推理能力。该基准与 ARC-AGI 2 的相关性高达 0.83。结果显示 GPT-6 Astra 下棋表现最强,达到 2568 Elo 领跑各模型。

2026-09-17 ~ 2026-09-17 · 2 条相关