TD-JEPA 从离线日志学时间进展,控制任务全面优于 LeWM
HKBU-KnowComp · hf · 2026-07-29
- 论文提出 Temporal-Distance JEPA(TD-JEPA),用于潜在世界模型的预测控制。
- 它在 LeWM 式 JEPA 规划器上做了关键改造:不再只依赖潜空间欧氏距离,而是从无奖励轨迹中挖掘一个有方向的时间距离代价。
- 这套监督有两层作用:一是当进展更接近拓扑关系时,直接作为规划时的代价函数;二是在欧氏规划仍有用的环境里,改善表示学习本身。
- 在锁定评测下,TD-JEPA 在 Two-Room 上达到 100.0% 成功率,而 LeWM 为 97.4%;同一 checkpoint 下,OGB-Cube 比 LeWM 提升 14.2 分。
- 作者还称,该方法在所有评测环境中都能与或超过 LeWM 和 RC-aux,消融实验显示,方向头、跨轨迹负样本和 rollout consistency 都有贡献。
「研究」频道最新
- VisualPatchWorld:用代码构建世界模型实现高效规划 — HKBU-KnowComp · 2026-07-29
- 分阶段诊断发现,短文本生成的主要损失在 codec — ITMO · 2026-07-29
- Nature 论文测得相变前后序参量的非高斯统计 — burny_tech · 2026-07-29
- Quanta 讲述 2026 菲尔兹奖得主于登的严谨研究风格 — burny_tech · 2026-07-29
- 新 scaling law 发现:部分规模下重复训练胜过改写 — burny_tech · 2026-07-29
- 经验蒸馏复现:保住 44.1% 的代理 ICL 增益 — burny_tech · 2026-07-29