用近 5TB 人类下棋数据做离线 RL,挑选更有教学价值的国际象棋谜题
allenainie · x · 2026-08-18
作者团队用一年近 5TB 的人类行为数据训练离线 RL 策略,目标是推荐教学价值更高的国际象棋谜题。过程中踩了不少坑,最终找到一套行之有效的 recipe,并邀请国际大师、特级大师等高水平棋手盲评——结果表明该策略推荐的谜题对棋手来说更有趣且更具挑战性。
所属事件:离线强化学习挖掘5TB对局数据筛选高价值棋题(2 条相关)→
「研究」频道最新
- 开发者发布 LLM 文本水印原理可视化 Playground — grabcard · 2026-08-18
- 给鬃毛机器人装上大脑:首个感知-预测-行动的自主微型机器人 — maier_ak · 2026-08-18
- 技术定义:Transformer 是混合特征与序列维度的架构 — PandaAshwinee · 2026-08-18
- 从零推导构建 PyTorch 分布式训练框架 — hkproj · 2026-08-18
- Stanford 发布 VISTA 机器人语义导航代码 — rsasaki0109 · 2026-08-18
- HarnessEval-W:分层子 Agent 分解视觉世界评估 — MirroS-Lab · 2026-08-18