PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment
Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng
cs.RO, cs.CV
2026-08-14
中科院自动化所等发布机器人过程评测工具包,用过程奖励模型把 rollout 视频转成进度曲线再算九项指标;π0.5 综合最强,仿真到真机平均进度落差 16.5 个百分点,模型大小与性能无明显相关。
机器人操作评测被二元成功率统治。两个同样标失败的 rollout,一个开局就散架,一个做完了 90% 才掉链子,在 SR 里是同一个数字;两个同样标成功的 rollout,一个干脆利落,一个靠反复犹豫和纠偏硬蹭过去,也是同一个数字。规则打分能细一点,但写死的规则跟不上多样失败模式。评测要能回答的是:模型卡在哪、犹豫多久、退步后能不能恢复。这对长程多任务操作越来越重要。
管线三步:输入 rollout 视频加任务指令,过程奖励模型(PRm)逐帧估计任务完成度得到进度曲线,再从曲线算指标、出报告。指标体系叫 OPD(Outcome-Process-Diagnosis)。1.5 版在 1.0 的 MC@25/50/75(里程碑覆盖率)、MP(最大进度)、PPL(路径加权进度长度)、CRA(累计回退面积)、STR(停滞比)之上新增三个条件指标:
默认判官用 Robo-Dopamine(Forward)。评测对象是 RoboDojo 基准已公开的 rollout 视频,真机 9 个模型、仿真 16 个,不微调不改模型,只锁 2026 年 7 月 3 日的榜单版本防针对性优化。配套发布 RoboPulse++,700 条轨迹、2,244 个人工标注的 Rising/Falling 区间,专门测判官模型本身灵不灵。
RoboPulse++ 上专用 PRM 明显强于通用 VLM:Robo-Dopamine(Forward) 宏 F1 0.84、准确率 0.82,最好的 VLM 组合(Sequence 风格的 Qwen 3.6 Plus)只有 0.50/0.66。识别退步比识别进步难得多:最好模型的 Rising F1 到 0.92,Falling F1 只有 0.63,瓶颈在 Falling 召回。155 个 Falling 错误样本里 78.1% 是交互关系失败(抓脱、放偏),21.9% 是任务顺序错误。
真机榜(Table 2)头几名:π0.5 的 MC@25 85.29、MC@50 60.59、SR 17.06、FNS 45.39 全场第一;Spirit v1.5 在已测 rollout 里一次都没成功(SR 0),SQS 无法计算。五个核心发现:
| 发现 | 证据 |
| VLA 普遍强于 WAM | 仿真榜 Top-3/5/10 里 VLA 占比 100%/80%/60%,WAM 是 0%/20%/40% |
| 模型大不等于强 | 参数量与 11 指标平均排名无正相关,4B 的 π0.5 压过 5-6B 的 WAM |
| π0.5 综合最强 | 真机仿真两榜均列第一梯队 |
| 精细操作最好做 | Precision 类任务在 MC@25/MP/FNS 全面领先;开放词汇最难且分数挤在低端 |
| 仿真代表不了真机 | SR 秩相关 ρ=0.58,MP 只有 0.18;九个共享模型真机进度全部低于仿真,平均落差 16.5pp |
判官可靠性还有一条硬证据:用进度曲线反推成功率,与 RoboDojo 官方 SR 的平均绝对误差仅 1.31.6 个百分点,模型级秩相关 0.88(仿真)和 0.96(真机),进度曲线没有丢掉传统结果信息。效率上单卡 H100 批量推理把 Robo-Dopamine-4B 的 2.1 小时视频判完时间从 29.3 分钟压到 7.8 分钟。
对具身智能团队,这套工具把「模型失败在哪一步」从看视频猜变成曲线读数,直接指明补数据补训练的方向。SR 与过程指标排名不一致这个结果,意味着只看成功率的选型会系统性看走眼。Sim-real 秩相关 0.18 是给整个领域的一盆冷水:仿真刷到顶不说明任何真机问题,精细对齐类任务(Classify objects、Hang mugs、Insert tubes)掉得最狠。RoboPulse++ 顺带把「PRM 本身靠不靠谱」变成可测的事,Falling 识别弱这个短板被量化出来了。
全部结论建立在第三方基准公开的 rollout 视频上,覆盖面受制于 RoboDojo 一家。判官本身是 Robo-Dopamine,同源偏差没法自证,虽然 RoboPulse++ 提供了外部校验渠道,但 Falling F1 只有 0.63 意味着依赖退步识别的指标(CRA、DRR)噪声不会小。SQS 在真机端因多数模型 SR 太低而没法可靠估计,直接没比较。9 个 Sim-Real 共享模型的结论受样本量限制。「更公平的过程评测」会不会诱导针对进度曲线的优化,论文没讨论。作者群来自多个具身智能团队,评测对象包含其相关工作,利益关联值得留意。