开发者提出用世界模型合成环境训练 RL 被低估

开发者 Will Depue 提出用世界模型做强化学习是被严重低估的研究方向:在无法直接访问生产环境时,可把带负反馈的生产轨迹喂给模型,让它生成能改善反馈的合成代码库与情境,借鉴机器人仿真思路在合理规模数据上完成训练。他同时指出最大隐患是策略会「黑掉」世界模型、利用模拟器不完美进行 reward hacking,但认为存在缓解手段。

2026-09-22 ~ 2026-09-22 · 3 条相关