用近 5TB 人类下棋数据做离线 RL,挑选更有教学价值的国际象棋谜题

allenainie · x · 2026-08-18

作者团队用一年近 5TB 的人类行为数据训练离线 RL 策略,目标是推荐教学价值更高的国际象棋谜题。过程中踩了不少坑,最终找到一套行之有效的 recipe,并邀请国际大师、特级大师等高水平棋手盲评——结果表明该策略推荐的谜题对棋手来说更有趣且更具挑战性。

所属事件:离线强化学习挖掘5TB对局数据筛选高价值棋题(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →