GPT-6 Astra 国际象棋实测:1320/1500 档全胜,1700 档两连败
stayhappyenjoylife · reddit · 2026-09-08
作者用 Stockfish 18(UCILimitStrength、每步固定 20 万节点预算)对 GPT-6 Astra 做了六盘完整对局测试:模型每轮获得当前局面 FEN,但没有引擎、合法着法列表、开局库、残局库、联网、代码执行或任何外部工具。
结果:Astra 在 1320 和 1500 限制档各赢两盘(4-0),在 1700 档连输两盘(0-2)。复盘 1700 对局时,Astra 一度达到 +4.22 优势,随后逐渐吐回并出现决定性失误。作者明确提示:limiter 档位不等价于同分人类棋手的 Elo,六盘也无法给出正式等级分;每轮喂 FEN 的设定只测「给定局面的决策能力」,不证明模型能凭空记住整个棋盘。
另有预注册的可靠性测试:160 次响应中 159 次合法且格式正确,各条件间无显著差异。PGN、prompt、原始输出、方法论与冻结基准快照全部公开于 GitHub 的 blunder-zero-ai-chess-benchmark 仓库(分析由作者自建的 Blunder Zero 项目生成,未夹带推广)。
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11