DreamTrue: Action-Faithful Robot World Model with Counterfactual Post-Training
Junyan Li, Ruizhi Li, Yu Liu, Xiangshuo Liu, Mingchao Sun, Hongyu Pan, Mu Xu, Lue Fan, Zhaoxiang Zhang
cs.RO, cs.CV
2026-10-09
DreamTrue 用离线几何标定对齐动作渲染,再以缺陷奖励做反事实后训练,把 AgiBot 上相对 Stage I 的交互缺陷率从 48.12% 降到 6.25%,录制 nDTW 达 0.8772。
机器人世界模型要当仿真器:给定初始多视角画面、任务指令和动作序列,生成未来视频。能用,得同时满足两件事。臂按给定轨迹走,物体按接触该动才动。
公开录像在两头都缺。动作若渲染成图像条件,就依赖相机内外参;标定一偏,渲染出来的臂和画面里的臂错位,监督从一开始就是歪的。另一头几乎全是成功演示,抓空、打滑、失去支撑很少。模型会倾向动作没抓住,物体也跟着夹爪升起。这种幻觉抬高成功率,拿去选动作或给策略打分都会偏乐观。补采真机很贵。DreamTrue 修标定、改轨迹,不再加真机数据。
来自中科院自动化所 NLPR 与阿里巴巴高德。生成器是跨本体的多视角视频 DiT(扩散 Transformer),动作从 VACE 支路注入。VACE 是把视觉条件送进视频主干的旁路。三步:离线标定、监督训练、奖励后训练。
标定不另拍标定板。录好的关节角加上初始相机参数,把 URDF 投进画面。URDF 是连杆和关节的几何文件。RoMaV2 做稠密匹配,分割模型 SAM3 把匹配限制在手臂。优化量是内参、外参、畸变和安装偏移。目标函数压渲染点的重投影误差,并要求跨帧、跨视角里看到同一点的两条光线与相机中心连线共面。随后用这套参数渲染整段动作的 RGB、深度和掩码,夹爪开合写进背景颜色,相机运动写成 Plücker 射线图。本体之间的动作定义对不齐,画成同一格式就能共用编码器。
Stage I 在 AgiBotWorld-Beta、DROID、RoboMIND 2.0、RoboTwin 2.0 上训练,过滤后 2232 小时、五种臂。损失是 flow matching,网络直接回归从噪声走向未来视频的速度场。
Stage II 补的是失败交互。末端位姿做一次 SE(3) 扰动(旋转加平移),从固定起点插到新终点,逆运动学得到一条没执行过的动作。初始画面固定,所以没有配对的未来帧。人在多个世界模型的视频上标三类缺陷:臂崩坏(L1)、物体变形或消失复制(L2)、交互不合理(L3,例如没抓住却把物体带离桌面)。微调的 Qwen 输出缺陷概率,奖励取相反数。原轨迹样本再加一项对真实帧的 PSNR。组内按 GDPO 归一化优势,DiffusionNFT 更新生成器。公开的标定有 153666 条、超过 1660 小时;缺陷标注 4.49 万段视频,其中 3.04 万条是缺陷标签。
AgiBot 上除留出的录制动作外,还有 54 个任务、160 条反事实动作。动作跟随看 nDTW,轨迹对齐之后的相似度。缺陷取三人多数表决,标注一致性 Fleiss κ 为 0.7817。基线是 DreamDojo、GE-Sim 2.0、Genie Envisioner、EnerVerse-AC。表里的基线列按该项最优填写,LPIPS 取更低的那个。
| 指标 | 全模型 | 去掉后训练 | 四基线最优 |
| 录制 nDTW | 0.8772 | 0.8711 | 0.8124 |
| PSNR / SSIM / LPIPS | 23.06 / 0.936 / 0.094 | 22.66 / 0.928 / 0.099 | 20.72 / 0.890 / 0.112 |
| 反事实 nDTW | 0.8831 | 0.8735 | 0.7817 |
| 物体缺陷率 | 3.12% | 31.88% | 3.75% |
| 交互缺陷率 | 6.25% | 48.12% | 7.50% |
两种动作下,全模型的 nDTW 和保真都是最高。交互缺陷从 Stage I 的 48.12% 降到 6.25%,160 条里的 10 条;物体缺陷从 31.88% 降到 3.12%。后训练之前,48.12% 仍高于 16.25% 与 7.50% 两条基线,补完才略好于最强的那条。交互缺陷 7.50% 的那条基线,录制 nDTW 只有 0.8063。综合分 EWMScore-P(WorldArena 质量指标的汇总)全模型为 72.51,低于去掉 RL 的 72.84。
AgiBot World Challenge 2026 世界模型赛道上,视觉质量 0.6246、动作跟随 0.9651、总分 0.829,三项第一。场景一致性 0.8974,低于 PAIWorld 的 0.9041。总分比第二名高 0.0045。
DROID 上相对 Ctrl-World,PSNR 从 22.00 到 22.95,SSIM 从 0.772 到 0.848,LPIPS 从 0.162 到 0.073。RoboMIND 2.0 与 RoboTwin 2.0 同表只有自身 PSNR,23.84 和 27.35。
策略实验对上了宣称的用途。三个双手 RoboTwin 2.0 任务、易难两档、四条 VLA(视觉-语言-动作策略,分别是 EventVLA、π0.5、X-VLA、starVLA),共 240 条动作、24 个组合。预测成功率对仿真真值,DreamTrue 拟合为 y=1.032x-0.009,Ctrl-World 为 y=0.919x+0.087。后者在低成功率区整段上漂,失败抓取被画成完成。成功率 MAE 从 12.92 个百分点降到 7.08,Spearman ρ 为 0.937,总偏差 +0.42 个百分点。
标定相对数据集原参数,掩码 IoU 在 130182 条 AgiBot 上平均提高 0.228,97.1% 的轨迹变好;63061 条 DROID 提高 0.212,91.6% 变好。推理时换上新标定,指标已经上升;训练也换上之后,AgiBot 的 PSNR 再增 1.28 dB 到 22.66,DROID 再增 1.30 dB 到 22.66,末端同步误差降到 4.60 与 8.06 像素。对比依赖立体深度的 PointWorld,输入只有 RGB 的这套标定,在 38356 条里 75.5% 的 IoU 更高。奖励模型在 4893 段留出视频上准确率 86.33%,macro-F1 为 74.21%;L1 的 macro-F1 只有 69.37,少见的本体缺陷并不稳。
拿世界模型给策略打分,最怕把失败画成成功。低成功率区不再整段上漂之后,仿真排名更贴近真值。多种臂共用一个检查点,标定和标注已公开。省下的是失败真机的补采,训练开销还在。
相对最强基线,交互缺陷少 1.25 个百分点,赛道总分高 0.0045。相对上一代模型,幅度有限。
论文写明:动作、生成器和奖励都在图像里看。遮挡或视角不够时,看起来合理的接触可以是错的,奖励也会打高。
反事实只改末端位姿再插值,打滑、形变和多点接触覆盖不到。160 条上的 6.25% 经不起几条标注翻转。策略对比只有仿真里的 Ctrl-World,没有真机闭环,也没显示下游策略被它训得更好。跨本体迁移只给了定性例子。物体缺陷 MAE 为 0.243。