用时间戳距离训机器人价值模型:7 千小时无偏好数据,超越偏好监督 SOTA

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

cs.RO, cs.CV, cs.LG

2026-08-11

RynnValue 用「到目标的时间距离」替代偏好标注训机器人价值模型,7 千小时数据超越偏好监督 SOTA,真实策略成功率 52.5% 升到 72.5%。

这篇在解决什么

通用机器人策略越来越靠强化学习来训,可这条链路的瓶颈不在策略容量,而在奖励监督。手设奖励很难泛化到开放任务,稀疏成功信号对长程行为又指导有限。现有的通用奖励模型大多把监督绑在任务内部的锚点上:偏好(轨迹两两比较)、参考示教,或局部状态比较,这些锚点都绑死在特定轨迹或比较集上,很难跨异构数据复用。最常见的兜底是归一化到 [0,1] 的 progress,但它只是轨迹内的坐标,不是 goal-conditioned 的 cost-to-go,跟控制论里 value 的标准定义对不齐,也很难在不同时长、不同本体、不同任务结构间保持一致。

方法

RynnValue 换了个框架:从「打分轨迹级锚点的奖励模型」转向「预测 goal-conditioned cost-to-go 的价值基座模型」,并用 temporal distance(时间距离)作为可扩展的监督目标。时间距离是从当前观测到语言指定目标的有向时间代价;在最小时间目标下,它就是 hitting-time cost-to-go。关键在于,时间距离的标签可以直接从时间戳算出来(只需先定一个完成截断点),于是 RynnValue 在 7 千多小时、约 300 万条指令条件片段上训练,完全不需要偏好或 progress 标注。原始片段来自 10 个数据集(AgiBot、EgoDex、Open X-Embodiment 等),经子任务分割与截断重标注后统一到同一个时间距离接口。

但光堆数据并不保证学到可靠的时间价值。多帧输入下,模型会走捷径:利用固定采样间隔、利用观测的呈现顺序,或从已暴露的其他 value 查询外推,而不是真的看视觉证据。RynnValue 用几招一起压制这些捷径:

模型架构搭在 RynnBrain 上,每组预测用 8 个重复 query token;两个分布式头(absolute/relative)用 256 个 symlog 分箱做 two-hot 回归,语言分支还顺带产出视频描述与匹配/成功判断。

时间距离再经 potential-based shaping 转成密集奖励:把预测距离取负当势函数,保留时间尺度而不是归一化到 [0,1]。

结果

在 RBM-EVAL-OOD 轨迹排序基准(976 条轨迹、6 个分布外数据集,Kendall τa)上,RynnValue-8B 平均 0.675、4B 也有 0.670,超过了用偏好加 progress 全监督的 Robometer(0.655),更是把只用 progress 的对照(0.292)翻了一倍多。在所有不用偏好监督的方法里,RynnValue 在六个数据集上全部最佳,把此前最强的 preference-free 均值从 0.502 提到 0.670 以上。指令-轨迹混淆矩阵的对角线边距 0.79,也高于最强基线的 0.67,说明它真的把估计锚在语言目标上、而非泛泛的视觉进展。

消融把每个部件的贡献讲清楚:去掉时间顺序打乱掉到 0.189(最大降幅),均匀采样掉到 0.379,去掉 value-isolation 掉到 0.482,去语言监督掉到 0.537,去 relative 掉到 0.627。一套缩放实验还显示:加任务多样性能让误差单调下降,而单纯加单任务内的样本量很快就饱和,多样性比数量更重要。

真实世界强化学习(Franka 双臂,4 个任务,每任务 20 次,零样本无目标域微调):在线 RL 平均成功率 RynnValue 72.5%,对 Robometer 52.5%、稀疏 48.8%;离线 RL(IQL on π0.5)82.5% 对 Robometer 63.8%、对 SFT 23.8%,还解掉了 SFT 完全做不出来的 Box-in-Drawer 与双手搬箱。

为什么重要

RynnValue 把「奖励标注」这个机器人学习最卡的环节,从昂贵的人工偏好换成几乎免费的时间戳,证明了时间距离是一个能跨本体、跨视角、跨数据源统一的可扩展监督目标。模型权重、代码、项目页全部开源,可以直接当奖励接口接进策略训练。

局限与存疑

作者承认:目前只从一小段采样观测估时间距离,扩到更长程与流式推理是未来工作;目标假设近似是最小时间,没纳入能量、安全、精度等任务相关代价;计划扩到灵巧手与移动操作(导航与交互需在同一价值接口里联合建模)。补两条:在 Box-in-Drawer 这类需要精密协调的任务上在线增益有限,因为奖励只看第三人称 RGB、视觉相近的位姿对应很不同的抓取稳定性,中间奖励难以校准;4B 到 8B 增益很小,既说明配方不靠堆参数,也留下「再大是否还值得」的疑问。另外奖励 shaping 仍保留了人工标注的稀疏成功终信号,并非完全自治。

术语

原文与代码

相关论文

全部论文解读