画质挤在 0.73-0.81,真本事却从 30 到 84.6:人转机器人视频基准 H2R-Bench

H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang, Zeyu Zhang, Yao Mu, Guangtao Zhai, Ning Liu

cs.RO, cs.CV

2026-08-13

用 120 段第一人称人类操作视频配两种机器人形态,评测视频模型能否把人的操作忠实转成机器人视频;11 个模型里视频画质和真实转移能力几乎不相关(ρ=0.14)。

这篇在解决什么

机器人学习很缺数据,而采集机器人操作演示又贵又难规模化:要专门的硬件、遥操作接口、标定好的相机、安全约束,还得一遍遍真实执行。第一人称的人类操作视频倒是海量,天然记录了物体可供性、手与物体的接触、操作意图和物理状态变化。一个自然的想法是用视频世界模型当桥梁,把人类演示转成机器人操作视频,补上机器人数据的缺口。

但这里有个没人认真测过的能力:跨具身(cross-embodiment)转移。现有视频基准(VBench、WorldModelBench、RoboWM-Bench 等)要么只评画面通真度,要么只评「给定文本或机器人状态生成的视频」,没有一个评测「把一段人类演示忠实转成另一种机器人形态」。它们也诊断不了人转机器人特有的失败,比如换错了末端执行器、或者交互跟源视频对不上。难点不在生成一个看起来像机器人的视频,而在保住源演示里的操作证据,同时把执行换成另一种形态。

方法

H2R-Bench 走的是「以源视频为准绳」的评测思路。给定一段第一人称人类操作视频和一个目标机器人形态,模型生成同任务的机器人视频。源视频被当成「发生了什么」的证据,不是视觉风格参考。成功的输出要保住任务目标、达成目标所需动作、以及操作者与物体之间可见的交互。不要求姿态或轨迹模仿:夹爪和灵巧手可以用不同策略完成任务,只要新策略与目标形态和源任务兼容。

基准用 120 段来自 EgoDex 测试集的第一人称片段,每段配两种目标形态(平行夹爪、灵巧手),得到 240 个案例。源视频均匀分布在六类操作上(每类 20 段):刚体重排、机构驱动、插接装配、可变形物配置、散料转移、表面或材料变化。标注由 Qwen3.7-Plus 先生成(初末状态、相关物体、所需动作、源侧接触证据),再人工逐条核对。

评测给每个生成视频打五个维度的分。M1 目标状态完成、M2 动作事件完成、M3 功能接触转移、M4 形态正确性(没有机器人或仍是人在操作,直接记 0)、M5 任务无关的视频画质。前四项由三个多模态判定模型(Gemini 3.5 Flash、Qwen3.7-Plus、GPT-5.4)按 0-4 评分表独立打分取平均;综合分 H2RCore 给接触和形态各 0.3 的权重(合计 60%),目标和动作各 0.15,画质只占 0.1。生成时用每个模型最强的公开源条件接口:能吃视频的吃完整视频,只能吃图片的吃按序采的源帧,主设置里不给目标机器人的参考图,纯靠文本指定形态。

结果

11 个模型被测:5 个闭源(Seedance 2.0、Wan2.7、Kling-V3、Veo 3.1、Grok Imagine Video),6 个开源(Wan2.2、LTX-2.3、HunyuanVideo 1.5-I2V、SkyReels-V3-R2V、LongCat、Mitty-EPIC14B)。

排名(夹爪 / 灵巧手 H2RCore)模型分数
第 1Seedance 2.077.3 / 84.6
第 2Wan2.776.5 / 83.1
第 3Kling-V374.5 / 81.7

前三名清一色是能吃完整视频的模型。头部之间目标和动作分数差不多,差距主要来自接触转移和形态正确性。能说明问题的是反面案例:Veo 3.1 拿到夹爪赛道最高的目标完成分(0.725),但形态正确性只有 0.100;HunyuanVideo 画质两项都最高(0.806/0.808),接触分却停在 0.185、形态分近乎 0。只能吃图片帧的模型,形态分几乎全是 0(Wan2.2、LongCat 为 0.000,SkyReels 0.004)。

最硬的一条结论:视频画质和真实转移能力几乎不相关。VBench 风格的画质分挤在 0.73-0.81 的窄带里,H2RCore 却从 30.0 拉到 84.6,两者秩相关只有 0.14。画质最好(HunyuanVideo)的反而接近 H2RCore 榜尾。

形态也有影响:换成灵巧手,11 个模型里有 9 个 H2RCore 上升,平均涨 3.3 分,接触分 11 个模型全涨(+0.055)。原因是灵巧手的形态更接近源视频里的人类演员,换人时接触更容易保住。三位人类标注者复核,与自动评分的秩相关达 0.883。

为什么重要

这篇的实用价值是给「视频世界模型能不能当机器人数据来源」这件事立了第一把像样的尺子,而且尺子专门卡在最容易骗人的地方:画面好看不等于任务做对了、也不等于换对了机器人。对想做人类转机器人视频生成的人来说,H2R-Bench 把失败拆成了目标、动作、接触、形态四档,能直接看出模型栽在哪一环。结论也泼了盆冷水:当前最强的一批视频模型,在跨形态操作转移上仍有明显差距。

局限与存疑

案例规模有限:120 段源视频、6 类操作、2 种形态,覆盖面比不上通用视频基准。源视频只来自 EgoDex 一家,操作类型偏居家桌面场景,工业或移动操作没碰。前四项指标靠多模态判定模型打分,虽然有三人人工复核且相关性高,但判定模型本身的偏见没法完全排除;M5 用的 MUSIQ、CLIP 美学等指标也都是代理指标,不是真实用户感知。基准只评「能不能转对」,没评转出来的视频拿去训练机器人策略到底有没有用,那一步还是空的。

术语

原文与代码

相关论文

全部论文解读