告别昂贵推理搜索:INTACT 实现免搜索世界模型
zju · hf · 2026-07-31
前潜在世界模型虽然能预测动作如何改变场景,但通常需要昂贵的测试时搜索来恢复所需动作。本研究提出了 INTACT(意图转动作),一个端到端的 JEPA 架构,将带有动作标签的轨迹转化为可部署的意图转动作接口。
- 架构设计:通过相同的四槽语法和共享参数,使局部和目标运动意图的输入图之间保持同构。支持从 RGB 证据到动作有效潜在意图坐标的完整转移。
- 免搜索策略:利用条件均值直接作为免搜索策略,无需点对点潜在匹配或全局线性动态。可选的局部 CEM 中心化搜索能大幅减少采样需求。
- 性能表现:在四个官方 LeWM 任务上,单 epoch 零搜索模型成功率高达 85.78% 至 100%。使用 384 个候选序列(而非 9000 个)即可达到 96.86% 的宏观成功率,将采样减少了 23.44 倍。
所属事件:浙大清华推出免搜索世界模型INTACT(2 条相关)→
「具身」频道最新
- Jonas Frey 等发布足式机器人新机遇综述 — ChongZzZhang · 2026-07-31
- Qlayers机器人替代高危人工,储罐喷涂效率提升六倍 — lukas_m_ziegler · 2026-07-31
- 50余家机构联手,打造全球最大触觉操作数据集 — RemiCadene · 2026-07-31
- 高通冲刺 AI 游戏时代:端侧算力将开发周期缩至 5 天 — 智东西 · 2026-07-31
- 清华等提出 Harness VLA,无需重训让冻结机器人模型成功率大增 — jiqizhixin · 2026-07-31
- 专家揭示机器人演示视频的潜规则:所见即所得 — chris_j_paxton · 2026-07-31