开发者开源 BYOK 棋类测试场,考验五类大模型的合法落子能力

wilsonye · reddit · 2026-09-08

作者做了一个与「套壳 Stockfish」相反的演示:模型必须在文本中输出可解析的合法落子,由规则引擎执行,一场比赛中出现 3 次非法或无法解析的输出即判负。

作者最想看到的数据:哪些模型能全程保持合法走法、列出合法走法是提升棋力还是仅改善语法、以及各模型在象棋/围棋上比国际象棋先崩溃到什么程度。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →