Q-Planning 让机器人策略自我改进:Q 函数吃成败轨迹减少人工干预

micoolcho · x · 2026-09-18

RoboPapers 专访 Varun Giridhar3 与 Animesh Garg,介绍 Q-Planning 方法:模仿学习+人工干预推动了近期机器人进展,但通过针对性干预把策略调到可部署的成功率非常耗时耗力。

Q-Planning 的思路是从 pi-0.5 这类大策略出发,加一个 Q 函数估计器预测价值而非仅输出动作;在线利用成功和失败的 rollout 同时更新 Q 函数,再用它引导采样与轨迹选择。仅需少量 rollout 就能显著提升表现,让策略在没有人工干预的情况下自行改进。

所属事件:Q-Planning 让冻结机器人策略靠小 Q 函数自我改进(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →