Learning Foresight without Explicit Trajectories for 3D Diffusion Policies
Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Changbo Yan, Lijun Wang, Huchuan Lu
cs.RO, cs.CV
2026-09-18
用稀疏未来夹爪状态监督一段隐变量,推理时不输出轨迹。相对DP3,RoboTwin混合训练从56.1%到62.8%,LIBERO-40从37.08%到71.93%,真机五题从49%到72%。
3D 扩散策略擅长根据当前点云生成几何上站得住的密集动作,DP3 就是这条线。多步操作还缺另一件事:交互往哪去。下一步该碰哪里、双臂该往哪个构型收,通常被塞进同一个动作学习目标里,靠模型自己冒出来。
把未来写成航点、关键帧或整条轨迹,等于让预测器多说很多控制器未必要用的话。预测误差一旦变成跟踪目标,新观察想改动作也会被卡住。大连理工的做法更瘦:训练时用稀疏未来夹爪状态去塑造一段隐变量,推理时丢掉解码出来的点,只把这段隐变量当软条件。
骨干仍是 DP3:点云加机器人状态,观察窗 N=3,预测长度 H=8,执行 6 步再重规划。趋势编码器看这一短历史,输出 256 维隐变量。训练时一个辅助头从隐变量恢复 K=4 个未来夹爪目标,时间偏移默认 {5,10,15,20} 帧,左右夹爪各 4 维(xyz 加开合),一共 32 个数,均方误差,λ=1,和扩散动作损失一起端到端训。
推理时辅助头关掉。隐变量走原来的全局条件通路,额外的门控 FiLM 只打在 UNet 瓶颈,投影零初始化,开始时就是恒等映射。设计意图是:未来信息可以组织整段动作的结构,不要去扰动负责局部修形的上下采样块。参数从 262.43M 加到 271.67M,多 3.52%。4090 上 10 步 DDIM、batch 1,延迟从 50.28ms 到 50.90ms。
RoboTwin2.0 的 50 任务混合训练里,带同一 64 维任务嵌入的 DP3 是 56.1%,本方法 62.8%,50 题中 38 题上升。接触多、阶段多的题涨得最大,例如 rotateQRcode +37、placeshoe +26。
LIBERO-40 上整体 71.93% vs DP3 的 37.08%,其中 LIBERO-Goal 从 8.73% 到 77.53%。DexArt 平均 59.25%,比 DP3 高 7.25 分。真机 SO101 五题(推方块、叠碗、叠方块、抬篮、递瓶)平均 72.0%,DP3 为 49.0%,SimpleDP3 为 43.0%。
| 设置 | DP3 | 本方法 |
| RoboTwin2.0 50 任务混合 | 56.1% | 62.8% |
| LIBERO-40 整体 | 37.08% | 71.93% |
| LIBERO-Goal | 8.73% | 77.53% |
| DexArt 平均 | 52.00% | 59.25% |
| 真机五题平均 | 49.0% | 72.0% |
\DexArt 正文只写比 DP3 高 7.25 分,52.00 由 59.25−7.25 回推,论文未单列 DP3 的 DexArt 总分。
LIBERO 消融把机制说死了。同样多参数、关掉未来损失,只有 44.87%,相对 DP3 只多 7.79 分;加上未来监督再跳 27.06 分。把未来点直接写进条件是 65.28%,仍低于隐变量方案 6.65 分。瓶颈-only FiLM 是 62.8%,全块 FiLM 55.8%,交叉注意力 52.9%,说明未来条件打得越深越容易搅局部去噪。ACT 在六任务验证上从 24.00% 到 51.67%,趋势条件不绑死扩散 UNet。
给 3D 扩散策略加前瞻,不必再叠一个规划器,也不必在推理时跟踪预测航点。多 3.5% 参数、多 1.2% 延迟,LIBERO-Goal 和真机上的绝对提升已经不像边角打磨。对正在用 DP3 的人,这是改条件通路就能试的补丁。关键不是「预测未来」,是「用未来当训练信号,推理只留隐变量」。
真机只有 SO101、五题、各 20 次,迁移宽度还窄。点云被机械臂挡住时,趋势估计和基线一样吃亏,软引导救不了缺几何。
失败分析指向遮挡:臂挡住目标物体,点云残缺,趋势估计跟着偏,精细接触和对齐的题提升有限。未来偏移超出演示会被夹到末帧,短演示里「未来」其实是终点姿态。LIBERO 用 stride-4 物化轨迹,和 RoboTwin 的原始帧偏移不是同一时间尺度,跨基准的「5,10,15,20」不能直接当同一物理前瞻。ACT 实验是六任务、1 万步,不能外推到所有模仿架构。DexArt 的 DP3 总分需要从差值回推,原文表格在 HTML 里没有逐方法展开。没有和 FLARE、ForeDiffusion 在同一 3D 点云设定下的直接数字对照,和「预测未来图像」路线的优劣只能定性。