Q-Planning:冻结 BC 策略配小型 Q 函数,机器人从失败中自我改进
animesh_garg · x · 2026-09-18
Animesh Garg 团队论文《Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning》,配套播客即将上线,论文与代码已公开。
- 问题:行为克隆(BC)无法自我改进——策略失败后没有人类示教就学不到东西;RL 微调又难以扩展到数十亿参数的视觉运动策略
- 方法:给大型 BC 策略配一个小型 off-policy Q 函数。Q 函数估计价值而非模仿动作,可吸收成功与失败的部署 rollout;推理时对 BC 采样做单步 Q 加权平均(价值引导动作选择),在线自改进只微调 Q 函数,BC 权重全程冻结
- 结果:LIBERO 与双臂 RoboTwin 上经十轮自改进,LIBERO-10 从 93 提升到 99%,RoboTwin 从 83.8 提到 91.4%;两个接触丰富的双臂真机任务中,同一闭环在无人类干预下纯靠自身 rollout 持续提升
所属事件:Q-Planning 让冻结机器人策略自我改进(2 条相关)→
「具身」频道最新
- GPT-6 Astra 机器人控制基准碾压 Claude Fable 5.1:成功率 35% 对 15% — k7agar · 2026-09-18
- 全球前五协作机器人厂商 Doosan 携手 peaq,首台机器人已跑在 peaqOS — LexSokolin · 2026-09-18
- Neuralink 失语患者用脑机接口以合成原声对伴侣说出「我爱你」 — Polymarket · 2026-09-18
- 开源 OpenHarness 发布:软硬结合让 Claude Code、Codex 变领域专家 — dee_hw · 2026-09-18
- NewEyes 开放 Meta AI 眼镜第三方接入,让 AI 看你所看 — rohanpaul_ai · 2026-09-18
- Collov 推出 Meta 眼镜视觉 AI 助手 NewEyes,端云混合分工省 token — FellMentKE · 2026-09-18