开发者开源 BYOK 棋类测试场,考验五类大模型的合法落子能力
wilsonye · reddit · 2026-09-08
作者做了一个与「套壳 Stockfish」相反的演示:模型必须在文本中输出可解析的合法落子,由规则引擎执行,一场比赛中出现 3 次非法或无法解析的输出即判负。
- 覆盖国际象棋、围棋、象棋、五子棋、黑白棋五种棋类,支持人机对弈与模型对模型观战
- 两个可选提示开关:战术提示、合法走法列表(仅象棋/国际象棋/黑白棋);推理强度 Off–High 可调,温度保持厂商默认
- BYOK 架构,密钥不落盘,支持 OpenAI、Anthropic、Google、xAI、DeepSeek、Kimi、Qwen、GLM、MiniMax 等,MIT 开源可自部署
作者最想看到的数据:哪些模型能全程保持合法走法、列出合法走法是提升棋力还是仅改善语法、以及各模型在象棋/围棋上比国际象棋先崩溃到什么程度。
「编程与Agent」频道最新
- GPT-6 Astra + Seedance 2.5 实现任意视频角色批量替换 — matchaman11 · 2026-09-08
- 3D 地图生成何时成了编程与自动化模型的标配测试项目? — gethackteam · 2026-09-08
- danluu 评测 agent 的测试与验证能力:Google Astra 表现远超 Sol 5.6 — teortaxesTex · 2026-09-08
- 工程师呼吁 OpenAI 和 Anthropic 捐算力,用 Rust 重写 C 语言库 — cramforce · 2026-09-08
- 把 agent 记忆提交到 GitHub:markdown 文件实现跨机器跨 agent 续传 — ariG23498 · 2026-09-08
- Lerna 插件破解 Copilot HydraFusion,可把模型调用路由到 Azure — unixterminal · 2026-09-08