北大微软推BCP策略,机器人成功率大幅提升

jiqizhixin · x · 2026-08-26

北京大学与微软亚洲研究院提出 BCP(Bernoulli-Continuation Policy)策略,通过冻结基础 VLA 模型并训练一个 1640 万参数的“决策头”,让机器人能自主决定是继续执行当前动作块还是停止并重规划。

该方法将执行视界建模为伯努利“继续或停止”决策序列,利用 GRPO 优化以避免过度的 VLA 调用。实验结果显示,在 RoboTwin 2.0 的 50 项任务中,LingBot-VLA 成功率从 89.88% 提升至 93.94%,达到 SOTA 水平;真实机器人挂杯任务成功率从 44% 飙升至 84%。由于动作更精准、减少了无效运动,尽管重规划更频繁,总运行时间反而下降。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →