给DP3加3.5%参数的运动趋势隐变量,LIBERO-40从37%做到72%

Learning Foresight without Explicit Trajectories for 3D Diffusion Policies

Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Changbo Yan, Lijun Wang, Huchuan Lu

cs.RO, cs.CV

2026-09-18

用稀疏未来夹爪状态监督一段隐变量,推理时不输出轨迹。相对DP3,RoboTwin混合训练从56.1%到62.8%,LIBERO-40从37.08%到71.93%,真机五题从49%到72%。

这篇在解决什么

3D 扩散策略擅长根据当前点云生成几何上站得住的密集动作,DP3 就是这条线。多步操作还缺另一件事:交互往哪去。下一步该碰哪里、双臂该往哪个构型收,通常被塞进同一个动作学习目标里,靠模型自己冒出来。

把未来写成航点、关键帧或整条轨迹,等于让预测器多说很多控制器未必要用的话。预测误差一旦变成跟踪目标,新观察想改动作也会被卡住。大连理工的做法更瘦:训练时用稀疏未来夹爪状态去塑造一段隐变量,推理时丢掉解码出来的点,只把这段隐变量当软条件。

方法

骨干仍是 DP3:点云加机器人状态,观察窗 N=3,预测长度 H=8,执行 6 步再重规划。趋势编码器看这一短历史,输出 256 维隐变量。训练时一个辅助头从隐变量恢复 K=4 个未来夹爪目标,时间偏移默认 {5,10,15,20} 帧,左右夹爪各 4 维(xyz 加开合),一共 32 个数,均方误差,λ=1,和扩散动作损失一起端到端训。

推理时辅助头关掉。隐变量走原来的全局条件通路,额外的门控 FiLM 只打在 UNet 瓶颈,投影零初始化,开始时就是恒等映射。设计意图是:未来信息可以组织整段动作的结构,不要去扰动负责局部修形的上下采样块。参数从 262.43M 加到 271.67M,多 3.52%。4090 上 10 步 DDIM、batch 1,延迟从 50.28ms 到 50.90ms。

结果

RoboTwin2.0 的 50 任务混合训练里,带同一 64 维任务嵌入的 DP3 是 56.1%,本方法 62.8%,50 题中 38 题上升。接触多、阶段多的题涨得最大,例如 rotateQRcode +37、placeshoe +26。

LIBERO-40 上整体 71.93% vs DP3 的 37.08%,其中 LIBERO-Goal 从 8.73% 到 77.53%。DexArt 平均 59.25%,比 DP3 高 7.25 分。真机 SO101 五题(推方块、叠碗、叠方块、抬篮、递瓶)平均 72.0%,DP3 为 49.0%,SimpleDP3 为 43.0%。

设置DP3本方法
RoboTwin2.0 50 任务混合56.1%62.8%
LIBERO-40 整体37.08%71.93%
LIBERO-Goal8.73%77.53%
DexArt 平均52.00%59.25%
真机五题平均49.0%72.0%

\DexArt 正文只写比 DP3 高 7.25 分,52.00 由 59.25−7.25 回推,论文未单列 DP3 的 DexArt 总分。

LIBERO 消融把机制说死了。同样多参数、关掉未来损失,只有 44.87%,相对 DP3 只多 7.79 分;加上未来监督再跳 27.06 分。把未来点直接写进条件是 65.28%,仍低于隐变量方案 6.65 分。瓶颈-only FiLM 是 62.8%,全块 FiLM 55.8%,交叉注意力 52.9%,说明未来条件打得越深越容易搅局部去噪。ACT 在六任务验证上从 24.00% 到 51.67%,趋势条件不绑死扩散 UNet。

为什么重要

给 3D 扩散策略加前瞻,不必再叠一个规划器,也不必在推理时跟踪预测航点。多 3.5% 参数、多 1.2% 延迟,LIBERO-Goal 和真机上的绝对提升已经不像边角打磨。对正在用 DP3 的人,这是改条件通路就能试的补丁。关键不是「预测未来」,是「用未来当训练信号,推理只留隐变量」。

真机只有 SO101、五题、各 20 次,迁移宽度还窄。点云被机械臂挡住时,趋势估计和基线一样吃亏,软引导救不了缺几何。

局限与存疑

失败分析指向遮挡:臂挡住目标物体,点云残缺,趋势估计跟着偏,精细接触和对齐的题提升有限。未来偏移超出演示会被夹到末帧,短演示里「未来」其实是终点姿态。LIBERO 用 stride-4 物化轨迹,和 RoboTwin 的原始帧偏移不是同一时间尺度,跨基准的「5,10,15,20」不能直接当同一物理前瞻。ACT 实验是六任务、1 万步,不能外推到所有模仿架构。DexArt 的 DP3 总分需要从差值回推,原文表格在 HTML 里没有逐方法展开。没有和 FLARE、ForeDiffusion 在同一 3D 点云设定下的直接数字对照,和「预测未来图像」路线的优劣只能定性。

术语

原文与代码

相关论文

全部论文解读