离线强化学习挖掘5TB对局数据筛选高价值棋题

一项获得RLC 2026杰出论文奖的研究利用离线强化学习,处理约一年量级、近5TB的人类国际象棋对局行为数据,训练出能推荐高教学价值棋题的策略。团队在实验中踩过不少坑,最终总结出一套行之有效的训练配方,并邀请国际大师与特级大师参与评估,为棋类教学内容的智能筛选提供了新思路。

2026-08-18 ~ 2026-08-18 · 2 条相关