Q-Planning 让机器人策略自我改进:仅微调 Q 函数,LIBERO-10 达 99%
chris_j_paxton · x · 2026-09-17
Varun Giridhar、Animesh Garg 等提出 Q-Planning,给大规模视觉运动行为克隆(BC)策略配一个小型 off-policy Q 函数,实现自我改进而不依赖额外人类演示。核心机制:Q 函数估计价值而非模仿动作,可用成功演示训练,再吸收部署中成功与失败的 rollout——这是 BC 没有的不对称性。推理时用 Q 加权的单步平均从 BC 采样中选动作;在线自改进只微调 Q 函数,BC 权重完全冻结。结果:LIBERO-10 从 93% 升至 99%,双臂 RoboTwin 从 83.8% 升至 91.4%,在接近天花板的套件上也缩短了成功回合;两个真实机器人接触密集型双臂任务同样在无人干预下纯靠自身闭环提升。代码已开源。
「具身」频道最新
- 机器人团队把执行器竞态 bug 反手做成需要的功能 — eigenron · 2026-09-17
- ArmSoM Sige 7 开箱:RK3588 开发板主打边缘 AI 与机器人 — chrismatthieu · 2026-09-17
- 香港闭门机器人工作坊:聚焦基础模型、数据引擎与部署落差 — paigeinsf · 2026-09-17
- Innate OS 开源:面向通用机器人的智能体操作系统 — ycombinator · 2026-09-17
- Wayve 任命前汽车高管 Elisa de Martel 为新任 CFO — alexgkendall · 2026-09-17
- Tutor 发布新一代机器人 Sonny:可移动整车,搭载 Ti 系列 VLA — chris_j_paxton · 2026-09-17