DreamTraj:直接读取视频扩散模型隐变量预测 6-DoF 轨迹
SUSTech · hf · 2026-08-04
论文提出了 DreamTraj 模型及配套的 MOVE 数据集,通过挖掘视频扩散模型的内部表征,实现了高效的机器人操作轨迹预测。
- 创新点:不同于以往依赖生成完整视频再提取运动的昂贵管线,DreamTraj 仅需单张 RGB 图像和任务指令,直接从冻结的图生视频扩散模型的早期去噪步骤中读取运动特征。
- MOVE 数据集:包含 5,038 条以自我为中心的物体运动轨迹,并配有细粒度的自然语言指令,填补了当前数据集缺乏精细语言到运动标注的空白。
- 性能表现:轻量级的流匹配 Reader 将注意力轨迹解码为相对 6-DoF 姿态。与需要多帧或特权输入的预测器相比,DreamTraj 在平移和旋转上均达到 SOTA,且推理速度比先生成后提取的管线快 4.6 倍。
「具身」频道最新
- 专家实测 GPT-5.6 与 Gemini 机器人模型:能力惊艳仍缺真实数据 — m_wulfmeier · 2026-08-04
- 马斯克放话:Neuralink 脑机接口将在 6-12 个月内让盲人复明 — saibharadwaj · 2026-08-04
- 清华团队具身智能公司破壳机器人完成亿美元级 Pre-A 轮融资 — 创业邦 · 2026-08-04
- Minimax H3 本地实测:RTX 6000 Pro 生成 2MP 视频仅需 51 分钟 — JahJedi · 2026-08-04
- LeRobot社区已支持30多种机器人硬件,即插即用 — m_wulfmeier · 2026-08-04
- 新加坡国立大学打造双电机仿生章鱼机器人 — lukas_m_ziegler · 2026-08-04