机器人基础模型自我提升:Q-Planning将成功率25%提至80%
chris_j_paxton · x · 2026-08-26
针对机器人基础模型在困难任务上表现有限(如25%成功率)的问题,Q-Planning 提出了一种基于学习的“挽具”(harness)。它通过为大型视觉运动BC策略配备一个小的离策略Q函数,在不更新BC权重的情况下实现自我提升。
核心机制:
- 推理时:冻结的BC策略采样N个候选动作块,Q函数对其评分,执行加权平均的单步动作。
- 训练时:将成功和失败的轨迹加入回放缓冲,仅微调Q函数。
效果:
- 在LIBERO和双臂RoboTwin基准上,10次迭代将所有测试分数提升(如LIBERO-10从93%→99%,RoboTwin从83.8%→91.4%)。
- 在两个接触丰富的真实双臂机器人任务中,纯靠自主循环(无人类干预)实现了性能改进,仅耗时约30分钟。
「具身」频道最新
- 研究者探讨机器人世界模型,参加达姆施塔特自主学习研讨会 — breadli428 · 2026-08-26
- 中国人形机器人销量远超美国公司 — teortaxesTex · 2026-08-26
- Anchor-Align:解决 VLA 微调遗忘问题,泛化性大幅提升 — _krishna_murthy · 2026-08-26
- 中国初创 Rochu 推出液压驱动仿生人形机械手 — teortaxesTex · 2026-08-26
- MIT 教授观点:为何轮式机器人比双足更易部署 — BradPorter_ · 2026-08-26
- 首个机器人格斗赌局:200磅T800决战 — zealcaiden · 2026-08-26