离线强化学习挖掘5TB对局数据筛选高价值棋题
一项获得RLC 2026杰出论文奖的研究利用离线强化学习,处理约一年量级、近5TB的人类国际象棋对局行为数据,训练出能推荐高教学价值棋题的策略。团队在实验中踩过不少坑,最终总结出一套行之有效的训练配方,并邀请国际大师与特级大师参与评估,为棋类教学内容的智能筛选提供了新思路。
2026-08-18 ~ 2026-08-18 · 2 条相关
- 用近 5TB 人类下棋数据做离线 RL,挑选更有教学价值的国际象棋谜题 — allenainie · 2026-08-18
- RLC 2026 杰出论文:用离线 RL 挖掘 5TB 对局找高价值棋题 — allenainie · 2026-08-18