微软 DiVeR 聚焦决策关键状态训练验证器
微软研究院提出 DiVeR(Decision-Critical Verifier Learning),为视觉-语言-动作(VLA)模型学习更好的验证器,以支持验证器引导的测试时扩展。研究发现现有分类验证器平等对待轨迹中的所有状态,但只有稀疏的「决策关键」状态才存在意义重大的动作分叉。DiVeR 通过对这些关键状态加权训练,提升了 VLA 任务的验证效果与成功率。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 微软 DiVeR:决策关键状态加权验证器,提升 VLA 任务成功率 — MicrosoftResearch · 2026-10-07
- DiVeR:只在决策关键状态训练验证器,提升 VLA 测试时扩展 — SharonYixuanLi · 2026-10-07