Q-Planning 让机器人策略自我改进:仅微调 Q 函数,LIBERO-10 达 99%

chris_j_paxton · x · 2026-09-17

Varun Giridhar、Animesh Garg 等提出 Q-Planning,给大规模视觉运动行为克隆(BC)策略配一个小型 off-policy Q 函数,实现自我改进而不依赖额外人类演示。核心机制:Q 函数估计价值而非模仿动作,可用成功演示训练,再吸收部署中成功与失败的 rollout——这是 BC 没有的不对称性。推理时用 Q 加权的单步平均从 BC 采样中选动作;在线自改进只微调 Q 函数,BC 权重完全冻结。结果:LIBERO-10 从 93% 升至 99%,双臂 RoboTwin 从 83.8% 升至 91.4%,在接近天花板的套件上也缩短了成功回合;两个真实机器人接触密集型双臂任务同样在无人干预下纯靠自身闭环提升。代码已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →