DiVeR:只在决策关键状态训练验证器,提升 VLA 测试时扩展
SharonYixuanLi · x · 2026-10-07
- 新预印本 DiVeR(Decision-Critical Verifier Learning)研究如何为视觉-语言-动作(VLA)模型学习更好的验证器,以增强 Generate → Verify → Act 回路中的 Best-of-N 动作选择。
- 核心观察:并非所有状态对验证器学习同等重要。常规运动(穿越空旷空间、搬运物体)中候选动作相似,选择影响小,信号有限;而在对准抓取或放置等决策关键时刻,候选动作分歧大,微小差异即可改变结果。
- 方法围绕两点:通过采样动作间的分歧度识别决策关键状态,并据此训练验证器;同时该工作关联 NeurIPS 2026 的 PTA 研讨会(从预训练表征到行动智能体),受邀讲者包括 Aviral Kumar、Benjamin Eysenbach、Sherry Yang 等。
所属事件:微软 DiVeR 聚焦决策关键状态训练验证器(2 条相关)→
「具身」频道最新
- Generalist 机器人底盘模型复现拆装液压杆 O 型圈,秒级示教学新任务 — 141_1337 · 2026-10-07
- YC 新公司 Vexo 推常听 AI 手环:免重复交代上下文直接干活 — ycombinator · 2026-10-07
- LeCun 团队发布 H-JEPA:分层世界模型视觉规划成功率 18%→73% — ylecun · 2026-10-07
- 百万英里老司机参观 Tesla Semi 工厂:这个行业将被改变 — elonmusk · 2026-10-07
- Attacca:让具身智能体在 Minecraft 长程任务上完成率提升至 7 倍 — nanyang-technological-university-singapore · 2026-10-07
- WING 框架:从人类第一视角视频学机器人操作,LIBERO 成功率 99.2% — hongkongust · 2026-10-07