VR 厨房游戏采 10 小时数据,少样本真机操作成功率提高 18.3 点

From Gameplay to Policy: Towards Scalable Robot Data Collection via Gamified Robot-Free Interaction

Zheng Li, Liang Zhu, Junzhe Wang, Huayuan Chen, Ziyun Liu, Jiahang Cao, Xinyu Sheng, Pei Qu, Yufei Jia, Ximeng Zhang, Jiarui Xie, Zizhao Yuan, Haoang Li, Yi Cai, Jinni Zhou, Jun Ma

cs.RO

2026-09-16

港科广用 VR 做饭游戏采集无需机器人的操作数据,抽接触点和子目标预训练可供性,5 条示教仿真平均提高 10.0 点,真机提高 18.3 点。

这篇在解决什么

操作策略要泛化,先要有规模和多样性的交互数据。真机遥操作慢、绑死本体、难众包。仿真轨迹太齐,学出来的策略脆。UMI 这类手持夹爪还是定制硬件。网上的第一人称视频没有动作标签,还得人滤。

游戏能让人长时间玩、自己找解法。现有「游戏化」大多只是给遥操作叠一层分数,人还是坐在真机旁。这篇把采集做成不用机器人、能离线玩的 VR 游戏,再问:游戏里的操作经验,能不能在只给几条真机示教时帮到策略。

方法

两段。

Project Kitchen 是 Unity 做饭游戏,Meta XR SDK 跟踪裸手 26 关节,30 Hz 记下手、物体、抓放事件和任务进度。菜谱解锁、分支剧情、中英提示和实时反馈用来维持投入。每个子任务带成功谓词(空间、计数、体积),谓词一满足就切段、自动打标。倒液体用归一化液位乘容器容量,不跑流体仿真。片段再归成三类可复用原语:抓放、倾倒、工具使用(舀)。

Game2Policy 不从游戏学动作本身。接触点取抓取瞬间的掌心世界坐标,按当时相机投回图像,做成高斯热图,因为碗沿两侧都能抓,位置是多峰的。子目标是接触坐标系里的相对位姿,去掉世界系和相机运动,不当成机器人可执行目标。抓取区间用手部运动学:按该段录像的手指弯曲百分位(35/55)判断开合,滤掉短于 5 帧、长于 3 秒、接触前位移不足 6 cm 的间隔。

可供性网络冻 DINOv2,卷积出 64×64 接触热图,全局池化加 MLP 回归子目标。预训练加光照和背景随机。下游在线查询,top-K 热图峰送给策略:Transformer 策略(ACT、SmolVLA)当额外 token,Diffusion Policy 用 FiLM 拼进条件向量。可供性头用更低学习率和行为克隆一起微调。

结果

游戏侧先采 10 小时。仿真是 LIBERO-Goal 三项,5 条和 50 条示教,三种骨干,3 个种子、每种子 50 次 rollout。

骨干5 条仅目标域5 条 Ours50 条仅目标域50 条 Ours
ACT65.576.475.679.1
Diffusion Policy62.770.977.379.6
SmolVLA66.176.976.583.5

5 条平均加 10.0 点,已经接近 50 条仅目标域的 76.5。Scratch 对照(同样加了可供性分支但随机初始化)和仅目标域持平,增益来自游戏预训练,不是多出来的容量。消融:去掉预训练掉 10.1 点;去掉接触点掉 7.7;去掉子目标掉 3.1。K=1 均值只掉 2.1,但 Bowl-on-Plate 的标准差从 2.6 升到 7.1。

真机是 Unitree G1 加 Dex1-1 平行夹爪,每项 10 条遥操作、20 次试验:抓放 10/20 到 14/20,倾倒 8/20 到 12/20,工具 12/20 到 15/20,合计 30/60 到 41/60,提高 18.3 点。Scratch 是 28/60。

数据层面相对 EPIC-KITCHENS-100:信号丢失从每秒 0.48 次降到 0.05,人工标注从 89977 降到 0。相对 LIBERO 脚本示教,接近方向散布大约 2.3 到 2.6 倍,接触链长度 17.7 对 1.04 和 0.98。10 人用户研究相对遥操作更不累、认知负荷更低、自觉多样性更高。

为什么重要

众包机器人数据的卡点经常是「必须有一台机器人」。这篇把采集和本体解耦,用游戏引擎状态当免费真值,再用本体无关的可供性当桥。对只有几条真机示教的实验室,10 小时 VR 玩法是划得来的先验。它不替代真机数据,是把少样本从「从零拟合」变成「微调已经会指标接触点的头」。

局限与存疑

作者自己列了三条:采集规模还小、监督停在可供性不是动作、游戏到真机仍有外观鸿沟。后续打算分布式扩大用户、用 3DGS 补外观、把手部动作重定向到灵巧手。目前 10 小时、一种做饭游戏、真机只有平行夹爪和 10 条示教,还谈不上已经众包。子目标明确写了是人手坐标系里的条件信号,不是可执行轨迹;从手到夹爪的形态差被实验部分覆盖,但没测灵巧手。用户研究 10 人,样本量只够示意。

术语

原文与代码

社区讨论

相关论文

全部论文解读