Reward-DAgger:通用奖励模型让机器人运行时监控跨任务迁移
ebiyik_ · x · 2026-10-07
作者发布其承诺的论文 Reward-DAgger:用通用奖励/进度模型(如 Robometer)做机器人部署的运行时监控(runtime monitoring)。
核心问题:现有方法依赖任务专属的失败模型或与策略绑定的不确定性估计,换任务或更新策略就要重训/重标定。Reward-DAgger 尝试构建一个能同时跨任务、跨策略迁移的「门控」(gate)。
作者结论:通用奖励模型的能力已经好到可以取代任务专属启发式,不再需要为每个任务单独决定何时请求人类纠正。
「具身」频道最新
- DiVeR:只在决策关键状态训练验证器,提升 VLA 测试时扩展 — SharonYixuanLi · 2026-10-07
- 百万英里老司机参观 Tesla Semi 工厂:这个行业将被改变 — elonmusk · 2026-10-07
- Attacca:让具身智能体在 Minecraft 长程任务上完成率提升至 7 倍 — nanyang-technological-university-singapore · 2026-10-07
- WING 框架:从人类第一视角视频学机器人操作,LIBERO 成功率 99.2% — hongkongust · 2026-10-07
- 波士顿动力任命前亚马逊高管 Rohit Prasad 为新 CEO — SumitGup · 2026-10-07
- 20 分钟生成可编辑 3D 机器人实验室布局,实测 Illoca 工具 — Stefania_druga · 2026-10-07