Q-Planning 让冻结机器人策略自我改进
Animesh Garg 团队发表论文提出 Q-Planning 方法:在冻结大规模视觉运动行为克隆(BC)策略的前提下,为其配备一个小型 off-policy Q 函数,仅微调 Q 函数即可让机器人策略从失败经验中实现自我改进。在 LIBERO-10 基准测试中,该方法达到 99% 的成功率,展示了无需重训策略本体的高效改进路径。
2026-09-17 ~ 2026-09-18 · 2 条相关
- Q-Planning 让机器人策略自我改进:仅微调 Q 函数,LIBERO-10 达 99% — chris_j_paxton · 2026-09-17
- Q-Planning:冻结 BC 策略配小型 Q 函数,机器人从失败中自我改进 — animesh_garg · 2026-09-18