GoBench:用围棋评估 LLM 推理,与 ARC-AGI 2 相关性达 0.83

Roland31415 · reddit · 2026-09-17

Roland31415 发布 GoBench,让 LLM 在 9x9 围棋上对阵从随机到超人级的 KataGo 对手阶梯,以衡量通用推理能力:

排行榜、代码与论文均已公开,作者承诺持续更新榜单。

所属事件:GoBench发布:用围棋测LLM通用推理(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →