Elo 低 360 分却连胜 5 局:Astra 国际象棋实战打脸静态评级
ziv_ravid · x · 2026-10-08
Peter Gostev 报告一个反直觉结果:让两个「非推理」模型边下棋边学习——各对 Stockfish 有 200 局学习机会后,Opus 的 Elo 比 Astra 高出约 360 分。但实战胜负却反转:Astra 连赢 Opus 5 局(此前先输了几局)。
- 该实验来自一个 AI 学下棋的实时站点,模型对弈过程全程用 Stockfish 评估局势( pawn 单位优势条、Elo 旅程曲线、非法着数统计)。
- Astra(页面标注 gpt-6-astra)的数据:对满强度 Stockfish 68 局几乎全败(0 胜 66 负),对 skill-0 档 78.8% 得分,对 Elo-1800 档 22.7% 得分。
- 作者的论点:「纸面评级 vs 真实表现」的经典反差,高 Elo 不保证对特定对手的胜率。
「Fun」频道最新
- 「Agent 冲出凸包」:sandbox 逃逸梗引发 AI 圈转发玩梗 — burny_tech · 2026-10-08
- 一条 prompt 让马斯克和 Optimus 登录 WoW,暴风城没准备好 — elonmusk · 2026-10-08
- 导出 300+ 条收藏夹后他发现:AI bot 修 X 界面比官方还早 — BecauseCulture · 2026-10-08
- 用 GPT-6.1 Sol 加 Codex 花 5 美元 10 分钟,把 54 分钟 DevDay 演讲剪成 90 秒视频 — gabrielchua · 2026-10-08
- 菲尔兹奖得主陶哲轩调侃 OpenAI:电影史新纪元式挖苦引热议 — nicko_rico · 2026-10-08
- Reddit 热议:Claude 道歉太卑微,用户反而不忍指出错误 — FirefighterOne319 · 2026-10-08