NVIDIA 发布 VeriFine:让评判器与策略共同进化,突破具身自我改进瓶颈
nvidia · hf · 2026-10-07
NVIDIA 推出 VeriFine,一个面向具身推理自我改进的 agent 验证框架,核心思路是让策略、训练课程与评判器(judge)共同进化。
- 策略改进环:用 rubric 评判器诊断反复出现的失败模式,据此构建自适应课程并优化策略。
- 评判器改进环:当进展停滞、验证成为瓶颈时,选择性地在信息量大的失败案例上引入人类指导,通过「coactive calibration」让人与 agent 消除分歧、收敛到客观的物理推理 rubric,再用修订后的评判器指导下一轮数据筛选与策略优化。
在驾驶与机器人导航任务上的实验表明,无论强化学习还是 SFT,策略与评判器能力都能持续同步提升,说明扩展验证能力是支撑持续自我改进的关键。
「具身」频道最新
- DiVeR:只在决策关键状态训练验证器,提升 VLA 测试时扩展 — SharonYixuanLi · 2026-10-07
- 百万英里老司机参观 Tesla Semi 工厂:这个行业将被改变 — elonmusk · 2026-10-07
- Attacca:让具身智能体在 Minecraft 长程任务上完成率提升至 7 倍 — nanyang-technological-university-singapore · 2026-10-07
- WING 框架:从人类第一视角视频学机器人操作,LIBERO 成功率 99.2% — hongkongust · 2026-10-07
- 波士顿动力任命前亚马逊高管 Rohit Prasad 为新 CEO — SumitGup · 2026-10-07
- 20 分钟生成可编辑 3D 机器人实验室布局,实测 Illoca 工具 — Stefania_druga · 2026-10-07