Reward-DAgger:通用奖励模型让机器人运行时监控跨任务迁移

ebiyik_ · x · 2026-10-07

作者发布其承诺的论文 Reward-DAgger:用通用奖励/进度模型(如 Robometer)做机器人部署的运行时监控(runtime monitoring)。

核心问题:现有方法依赖任务专属的失败模型或与策略绑定的不确定性估计,换任务或更新策略就要重训/重标定。Reward-DAgger 尝试构建一个能同时跨任务、跨策略迁移的「门控」(gate)。

作者结论:通用奖励模型的能力已经好到可以取代任务专属启发式,不再需要为每个任务单独决定何时请求人类纠正。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →