Q-Planning:冻结 BC 策略配小型 Q 函数,机器人从失败中自我改进

animesh_garg · x · 2026-09-18

Animesh Garg 团队论文《Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning》,配套播客即将上线,论文与代码已公开。

所属事件:Q-Planning 让冻结机器人策略自我改进(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →