微软 DiVeR:决策关键状态加权验证器,提升 VLA 任务成功率
MicrosoftResearch · hf · 2026-10-07
微软研究院提出 DiVeR,针对 VLA(视觉-语言-动作)策略的验证器引导测试时扩展。现有分类验证器平等对待轨迹中所有状态,但只有稀疏的「决策关键」状态才存在意义重大的动作分叉。
方法
- 从采样动作表征的离散度估计决策关键度
- 用该信号重加权验证器学习,聚焦动作选择最关键的状态,无需步级标注或额外环境交互
结果:在 LIBERO、RoboCasa 基准及 Franka Research 3 真机实验中,DiVeR 一致提升任务成功率,且验证器推理开销可忽略。
「具身」频道最新
- ETH 学生手搓 UMI 夹爪:完整记录硬件选型与校准细节 — SongShuran · 2026-10-07
- Kangwook Lee 撰文:游戏经验如何帮我们为物理世界造 AI — Kangwook_Lee · 2026-10-07
- 腾讯混元发布 WorldPlay2 世界模型,可用提示词实时操控一致世界 — Scobleizer · 2026-10-07
- 开源 VTOL 无人机 FMS70 用单一推进单元模拟火箭回收控制 — Scobleizer · 2026-10-07
- 浙江机器人公司发布人机羽毛球对战视频,人类还会赢吗 — Scobleizer · 2026-10-07
- 从业者指出机器人遥操作数据采集面临人才瓶颈 — paigeinsf · 2026-10-07