Q-Planning 让机器人策略自我改进,成功率从 25% 提升至 80%
Georgia Tech 等团队针对机器人基础模型在困难任务上成功率有限(如 25%)的问题提出 Q-Planning:由于追加遥操作 SFT 数据会因协变量偏移而效果有限,该方法为大型视觉运动 BC 策略配备一个小的离策略学习"挽具",让机器人策略实现自我改进,将任务成功率从 25% 提升至 80%。
2026-08-26 ~ 2026-08-27 · 2 条相关
- 机器人基础模型自我提升:Q-Planning将成功率25%提至80% — chris_j_paxton · 2026-08-26
- 机器人策略自我改进:Q-Planning 让成功率 25% 升至 80% — rbhar90 · 2026-08-27