机器人基础模型自我提升:Q-Planning将成功率25%提至80%

chris_j_paxton · x · 2026-08-26

针对机器人基础模型在困难任务上表现有限(如25%成功率)的问题,Q-Planning 提出了一种基于学习的“挽具”(harness)。它通过为大型视觉运动BC策略配备一个小的离策略Q函数,在不更新BC权重的情况下实现自我提升。

核心机制:

效果:

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →