连续学习基准:让模型自学200盘国际象棋,Elo几乎没涨
imjustnewatai · x · 2026-10-04
Peter Gostev 开发了一个「连续学习」基准:让模型以"学习并提高棋力"为目标,与 Stockfish 对弈 200 盘,可自选难度、记笔记,但禁止作弊(如调用引擎),并上线了实时观测网站。
初步结果:
- GPT-6 Astra:200 盘结束后 Elo 反而下降(满强度对手下 68 盘仅 2 平 66 负,rolling score 约 0.01)
- Opus:略有正提升,但可能在随机误差范围内,目前仍在继续对局
作者认为这类基准的意义在于测试模型在缺乏真正持续学习机制时的自我改进能力(类似 RSI 的早期代理指标)。转发者 imjustnewatai 也表示想复刻类似基准。
「模型」频道最新
- 开发者实测:Opus 5.5 成为主力推荐,配图能力也出彩 — ivan_bezdomny · 2026-10-04
- Anthropic 发布 Sonnet 5.5:提速 30%、每任务成本降 30% — dl_weekly · 2026-10-04
- whurley 吐槽 Gemini:最前沿的模型反而接不进我的谷歌账号 — whurley · 2026-10-04
- Step 5 Preview 登 Vals 榜,开源模型中排第 7 — StepFun_ai · 2026-10-04
- Fable 5.1 取代 Opus 5.5 成为默认推荐模型 — LillyPlayer · 2026-10-04
- Sonnet 5.5 对阵 GPT 6.1 Sol 下国际象棋:推理 tokens 差 18 倍 — adigrazia80 · 2026-10-04