连续学习基准:让模型自学200盘国际象棋,Elo几乎没涨

imjustnewatai · x · 2026-10-04

Peter Gostev 开发了一个「连续学习」基准:让模型以"学习并提高棋力"为目标,与 Stockfish 对弈 200 盘,可自选难度、记笔记,但禁止作弊(如调用引擎),并上线了实时观测网站。

初步结果:

作者认为这类基准的意义在于测试模型在缺乏真正持续学习机制时的自我改进能力(类似 RSI 的早期代理指标)。转发者 imjustnewatai 也表示想复刻类似基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →