斯坦福北大新论文:别在世界模型里训练,让 Q-learning 只用它做选择

rohanpaul_ai · x · 2026-08-23

斯坦福与北京大学的新论文《Q-Learning With World Models》(QWM)指出:直接在世界模型内部训练机器人策略,策略会继承世界模型的每一个错误,且任务越长、图像越脏,误差累积越严重。QWM 的思路是反其道而行——从不在模型内部训练任何东西:世界模型完全不参与训练,只在动作选择阶段辅助机器人决策。论文地址:arxiv.org/abs/2608.17163。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →