微软 DiVeR:决策关键状态加权验证器,提升 VLA 任务成功率

MicrosoftResearch · hf · 2026-10-07

微软研究院提出 DiVeR,针对 VLA(视觉-语言-动作)策略的验证器引导测试时扩展。现有分类验证器平等对待轨迹中所有状态,但只有稀疏的「决策关键」状态才存在意义重大的动作分叉。

方法

结果:在 LIBERO、RoboCasa 基准及 Franka Research 3 真机实验中,DiVeR 一致提升任务成功率,且验证器推理开销可忽略。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →