北大微软推BCP策略,机器人成功率大幅提升
jiqizhixin · x · 2026-08-26
北京大学与微软亚洲研究院提出 BCP(Bernoulli-Continuation Policy)策略,通过冻结基础 VLA 模型并训练一个 1640 万参数的“决策头”,让机器人能自主决定是继续执行当前动作块还是停止并重规划。
该方法将执行视界建模为伯努利“继续或停止”决策序列,利用 GRPO 优化以避免过度的 VLA 调用。实验结果显示,在 RoboTwin 2.0 的 50 项任务中,LingBot-VLA 成功率从 89.88% 提升至 93.94%,达到 SOTA 水平;真实机器人挂杯任务成功率从 44% 飙升至 84%。由于动作更精准、减少了无效运动,尽管重规划更频繁,总运行时间反而下降。
「具身」频道最新
- 中国人形机器人销量远超美国公司 — teortaxesTex · 2026-08-26
- Anchor-Align:解决 VLA 微调遗忘问题,泛化性大幅提升 — _krishna_murthy · 2026-08-26
- 中国初创 Rochu 推出液压驱动仿生人形机械手 — teortaxesTex · 2026-08-26
- MIT 教授观点:为何轮式机器人比双足更易部署 — BradPorter_ · 2026-08-26
- 首个机器人格斗赌局:200磅T800决战 — zealcaiden · 2026-08-26
- 旧金山机器人公司自研麦克风阵列,提升AI交互体验 — Scobleizer · 2026-08-26