Latent-Foresight 端到端学习可预测表征,世界模型一致超越两阶段基线
Efstathios Karypidis · hf · 2026-10-02
Latent-Foresight 提出端到端框架,联合训练 latent tokenizer 与基于流的生成动力学模型,让表征显式支持时间可预测性,用于场景未来演化预测的世界建模。
针对现有两阶段流水线(VFM 特征先经 PCA/自编码器压缩,再训练独立预测器)中表征学习与时间预测解耦、潜空间不保证可预测动力学的问题,作者引入多项关键设计防止 latent collapse,并对齐重建与生成目标。
实验显示,该方法学到时间上更连贯的潜表征,在多个未来场景理解任务与预测时距上稳定超越两阶段基线,且免去了单独训练阶段(含高分辨率适配)。代码与模型权重已在 GitHub 开源。
「研究」频道最新
- LOCI 混合空间记忆架构:流式视频世界模型复现重访场景 — IFM · 2026-10-02
- SAKIKO 审计框架揭示:行为改变不等于工具调用 LLM 的内部修复 — UniversityofBirmingham · 2026-10-02
- 学者痛批 arXiv 注水:AI 代写论文正淹没学术圈 — EhudReiter · 2026-10-02
- 做电磁学基础模型遇坑:FEM 求解器根本不在节点上算电场 — burny_tech · 2026-10-02
- AWSM:用 IMU/深度/位姿几何证据校正大模型 3D 场景重建 — anselm · 2026-10-02
- 研究:注意力非线性催生幂律 massive activation 与 scaling law — burny_tech · 2026-10-02