自然语言轴打偏好,真机四任务成功率比次优高出 38 个百分点

Freeform Preference Learning for Robotic Manipulation

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn

cs.RO, cs.AI, cs.LG

2026-07-01

FPL 让标注员用自然语言定义速度、卫生、摆放等比较轴,学语言条件奖励并训练奖励条件策略。四个真机操作任务平均成功率 75%,比次优 Filtered BC 高出 38 个百分点。

这篇在解决什么

机器人要从试错里变好,奖励得又密又准。成功/失败太稀:摆一桌饭要放大盘、小盘、杯子、刀叉,只有全对才给 1,中间过程几乎没信号。图像观测下手写稠密奖励更难。偏好学习用「两条轨迹哪个更好」能把信号加密,但把速度、安全、摆放质量、会不会砸盘子压成一个「总体更好」。长程任务里两条轨迹经常各有所长:一条用铲子但把吐司掉了,一条用手夹更稳但不卫生。标注员很难给一个总偏好,学出来的奖励也就糊。

Stanford IRIS 的 Freeform Preference Learning(FPL)把轴留在自然语言里:人自己定义比较维度,再沿每条轴做 pairwise 偏好。

方法

标注员并排看两条完整轨迹视频,沿若干轴投票,也可以标等价(等价样本直接丢掉)。轴可以事先定好,也可以当场用自然语言写。摆桌任务上包括大盘/小盘/杯/刀叉的摆放质量、正式程度、平滑、小心程度、速度、有没有弄坏环境。烤吐司更自由:295 对轨迹、超过 1477 条轴级标注、41 种不同说法。

真机奖励模型用 Qwen 3.5 VL 4B 做骨干,冻结视觉编码器,其余全参微调。不给每个轴单独训一个头,否则轴集合锁死,speed / fast / efficient 这种同义说法也对不上。输入是「What is the score for {轴名}?」加上腕部与第三人称图像序列,分辨率 128×128,带步幅下采样。对每个前缀打分,整条轨迹奖励是前缀分数求和,模型能看历史、给长程偏好做时间定位。训练仍是 Bradley-Terry:同一轴上,被偏好的轨迹分数要高于另一条。

策略提取不把多轴收成加权标量。加权更容易 reward hacking,也丢掉后面要的可组合性。FPL 选出一组代表性轴,把「轴名 + 按数据集标准化后的轨迹奖励」写成文本,条件化进策略。真机策略从 π0.5 全参微调,flow matching,action chunk 16,一次执行 8 步,3 万步、batch 32。测试时改目标奖励就能换行为,不必重训。奖励本身无界,所以按轴做标准化,prompt 里写到 1 位小数。

整套可以离线跑一轮,也可以迭代:rollout,再标偏好,再更新奖励和策略。轴会跟着策略变。折短裤早期标的是这一折做没做,后期变成皱褶和最终对齐。仿真为了迭代快,奖励模型改成每轴一个头,策略直接吃浮点向量,不再走语言。这一点和真机实现不同。

结果

真机四任务用 DROID 设置、Franka、双相机、关节速度控制,每方法 20 条 rollout。

方法摆桌盛吐司折短裤方块入碗平均
BC0.680.150.100.330.31
Filtered BC0.650.300.250.290.37
单轴偏好(配对数)0.640.000.250.430.33
单轴偏好(配标注量)0.770.100.300.190.34
FPL0.940.700.550.810.75

平均 75% 对 Filtered BC 的 37%,差 38 个百分点,就是摘要里那个数。单轴偏好即使把标注量对齐到 FPL 的 K 倍比较,平均也只有 34%。稀疏奖励在摆桌上能把东西放到位置,但经常是扔盘子而不是轻放。

仿真改自 Robomimic,3 个 seed。

方法物体重排成功率双峰方块吞吐反向双峰吞吐
BC0.040.710.25
单轴(配标注量)0.790.730.74
FPL0.841.191.24

双峰方块的离线数据:左桩有快有慢,右桩只有慢的。目标是又快又放到右桩。FPL 成功率 1.00、首次成功时间 253 步;演示基线 348 步,单轴匹配标注量 392 步。它把「放到右桩」和「快」拼出来了,训练数据里没有这个组合。同一策略把条件改成左桩,吞吐 1.24,Filtered BC 掉到 0。

标注成本也有数。每条轴标签约 3.4 秒,单轴偏好约 6.3 秒,大约快 1.85 倍,因为看一遍视频能打多轴。

为什么重要

这是对机器人偏好学习的一次具体改法。核心判断是:偏好信号糊,问题常常出在轴被压扁,pairwise 这个形式本身还能用。对已经在用 VLA 加离线数据做真机迭代的人,FPL 给出一条比稀疏成功标签更密、比手写奖励更省事的监督。测试时改奖励条件就能换碗、换桩,不用为每个目标再 fine-tune。折短裤那种轴随迭代变细的现象,说明自由文本轴能当课程,不必每次重写奖励函数。

Weighted Regression 消融说明多轴奖励模型本身不够:把各轴分数平均再做优势加权回归,仿真重排成功率只有 0.18。要可组合、测试时可改目标,得把轴和分数都条件进策略。

局限与存疑

论文自己写了三条:还是要人标,比无监督贵;测试时要选目标奖励值,还没自动化;策略条件在固定轴集合上,变长轴留给更强的 VLA。

另外几处读完要打折。真机表没有 Weighted Regression 和 Advantage Conditioning,38 点是对 Filtered BC,不是对五个基线在真机上的统一差距。每任务 20 条,折短裤 0.55±0.11,盛吐司 0.70±0.10,误差条不窄。四任务里只有盛吐司让标注员现场写轴,摆桌、折短裤、入碗是预定义轴,freeform 在真机上的覆盖没有摘要听起来那么满。仿真奖励模型是 K 个头不是语言模型,仿真上的组合性和可操纵性不能直接当成语言泛化的证据。图像 128×128、视觉编码器冻结,细粒度皱褶和卫生这类轴能打多准,论文没有单独报奖励模型准确率,只说按前 500 个 epoch 的验证集准确率选 checkpoint。等价标签直接丢,可能砍掉了「两条都一般」这种对校准有用的信号。

术语

原文与代码

社区讨论

相关论文

全部论文解读