自创环形棋+疯狂house变体,Claude Opus 4.5 仍击败人类棋手
Defiant_Ranger607 · reddit · 2026-09-30
发帖人自设了一套国际象棋变体规则——棋盘 h 线与 a 线首尾环绕、马走「三直一横」、被吃棋子可像 crazyhouse 那样重新 dropped 上盘——与 Claude Opus 4.5 对弈,模型只凭规则说明、起始局面和棋盘图就能每回合给出合法着法并获胜。他还复刻了冷门旧盘游 Nika 与 Claude 对战,模型同样取胜。
这动摇了他原本「棋类暴露 LLM 根本局限」的看法(跟踪变化棋盘、精确守规则、前瞻规划似乎不适合语言模型)。他由此向社区提问:哪些宽泛的问题类别 LLM 仍无法可靠解决?哪些局限是架构性而非靠更大模型和更多算力能弥补的?什么才算好的检验方式?
「模型」频道最新
- GPT-6.1-Sol 重绘性价比前沿,极致智能仍是 Opus 5.5 — randal_olson · 2026-09-30
- 用户称 30 分钟耗尽 500 美元档 ChatGPT 每周额度,怒指 OpenAI 虚假宣传 — RexDouglass · 2026-09-30
- ChatGPT、Claude、Grok 同时部分宕机 — rohanpaul_ai · 2026-09-30
- OpenAI DevDay 推 500 美元订阅遭群嘲,被指模型力不及竞品 — XFreeze · 2026-09-30
- $500 档 OpenAI 套餐开 ultrafast 后 40 分钟耗尽全部额度 — imjustnewatai · 2026-09-30
- 网友线性外推:GPT-6.1 Astra OSWorld 2.0 得分或达 79.5-80% — ChrisGPT · 2026-09-30