成败信号太稀疏,这篇综述统一机器人「进展奖励」的接口、方法与评测

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

Jianshu Zhang, Keliang Wu, Haoran Lu, Anbang Liu, Ce Zhang, Weijie Yin, Chengxuan Qian, Xiyuan Yang, Zhenyu Pan, Guo Ye, Han Liu

cs.RO, cs.CL

2026-07-23

机器人只靠成败信号训练反馈太稀疏。这篇综述把进展奖励建模拆成接口、方法、评测三层,给散乱的方法学搭了统一框架。

这篇在解决什么

机器人学习大多靠任务结束时的成败信号做奖励:抓到了算成功,没抓到算失败。这种终端信号只能回答「做完了没有」,回答不了当前这一步是在推进任务、原地踏步,还是在撤销之前已经做到的进展。长程任务里成功样本本来就少,反馈要等很久才来,策略很难判断中间哪一步走对了。

进展奖励(progress reward)想补上这个缺口,在执行过程中持续给反馈。但这个方向这几年方法冒出来一堆,各家用的观测、目标定义、输出形式、监督来源和评测协议都不一样,没法横向比较,也说不清每篇的结果到底验证了什么。这篇综述做的就是给这个散乱的领域搭一个统一框架。

方法

综述把进展奖励建模拆成三步,从外到内。

第一步是接口,把进展模型当成任务条件下的黑盒,只看它吃什么、吐什么。输入侧分当前状态(单帧、时序窗口、前后对比、仿真器状态访问)、目标给定方式(语言、目标图像、程序化结构)和输出形式(逐状态标量、进度增量、排序偏好、可执行奖励函数)。

第二步进到模型内部,把构造奖励的方法归成四类。一是直接拿冻结的基础模型打分,比如用 CLIP 算当前画面和语言目标的图文相似度,或者像 TOPReward 那样问 VLM「任务完成了吗」取「true」token 的概率。二是从时序或偏好监督里学,时序假设演示里越靠后的状态越接近完成,偏好则比较两段状态谁进展更多。三是指令微调,把进展预测当成显式的指令跟随任务来训(VLM 被明确要求先推理再给分),代表有 RoboReward、ProgressLM、Robo-Dopamine 等。四是程序化构造,把奖励写成可执行代码(Text2Reward、Eureka),可解释、易改。

第三步连到数据和评测,把评测分成进展保真度(标定、时序一致性、相对排序、任务接地、不确定性)、鲁棒性与泛化(跨任务、跨视角、跨本体、非单调执行)、下游效用(在线 RL、离线学习、检索过滤、规划)三组。

结果

综述本身不报新实验,它的产出是这张选型地图。几条主要发现:冻结 VLM 打分类方法零样本就能用,但分数更像是语义先验,不是标定好的奖励,常常还得配归一化、阈值或 prompt 工程。时序或偏好监督标注成本低于精确分数,但比较结果要再转成奖励函数,而且前提是偏好能用一致的分数表达。指令微调这一脉把进展预测写进 prompt 和训练目标,是目前最显式的一类。程序化奖励灵活可解释,代价是把难点从「预测奖励」挪到了「任务分解和可靠状态获取」上,可能出现代码本身没错但和行为意图对不上的情况。

数据构造则沿着人工参与度排开:纯人工能抓住难量化的任务语义(抓取是否稳、接触是否可接受)但标注贵;人在环只标关键帧再插值;全自动用时序结构或基础模型批量打标,可扩展但假设进展和时间正相关,或只能反映状态变量能表达的性质。

为什么重要

做机器人 RL 或奖励工程的人,过去要从一堆方法名里凭印象选型,选完还说不清它强在哪、弱在哪。这张地图给了一个对照框架:拿到一个进展奖励方法,能说清它的接口假设、监督来源属于哪一类,以及它声称的提升到底是在保真度量纲上验证过,还是在下游效用量纲上验证过。对要搭评测的人,后面那组分类清单(保真度怎么测、泛化怎么测、效用怎么测)可以直接当 checklist 用。

局限与存疑

综述自己点出四个共性短板。估计粒度普遍偏粗,稀疏采样和离散的进度 bin 会漏掉细微的位姿对齐、轻微物体位移或早期接触失败。固定速率假设是大问题,很多方法用时序或归一化时间戳当监督,等于默认进展匀速,但真实任务里停滞和突变是常态。推理延迟方面,大 VLM 要读多帧、解读指令、推理后才能出分,离线评测够用,每个控制步都跑不现实。长程记忆更是硬伤,同一画面在不同执行阶段含义不同(重复抓取多个物体时每次抓的动作长得一样但完成度不同),无记忆模型会把它们判成同一个进度。

这些都是整个子领域还没解决的问题,不是综述本身的问题。要提醒的是,综述整理的方法引用密集但几乎没给跨方法的量化对比,选型地图的「定量」部分基本要靠读者自己补。

术语

原文与代码

相关论文

全部论文解读