NVIDIA 提出 WorldTrace:突破视频世界模型长时记忆瓶颈
nvidia · hf · 2026-08-10
NVIDIA 团队发布了关于交互式视频世界模型视觉持久性的研究。研究指出,当模型生成的帧数超出训练范围时,由于时间旋转位置编码的偏移,模型难以从 KV 缓存中可靠地检索历史视觉信息,且直接压缩缓存会破坏记忆。
为此,团队提出了 WorldTrace,这是一个无需重新训练的记忆框架。它通过为每个摘要槽分配独特的虚拟位置来保持记忆的可寻址性,包含两种压缩方式:
- WorldTrace-Field:压缩历史以保持时间连贯性。
- WorldTrace-Landmark:在检测到的转换处存储逐字场景痕迹,用于情景回忆。
此外,团队还推出了 LoopBench 基准测试,用于评估压缩缓存在长路径绕行后重建先前场景的能力。实验表明,该框架将时间一致性提升了 15.5%,情景回忆提升了 19.5%。
「研究」频道最新
- Jeff Dean 离职后首场对谈:如何挑选值得做五年的研究问题 — FinanceYF5 · 2026-08-10
- Apple-π:首个基于物理定律的视频推理评测基准 — jiqizhixin · 2026-08-10
- 《图解大语言模型》开源 12 章代码与 300 张图解 — techNmak · 2026-08-10
- ICLR 2026 论文 Mobile-GS:实现移动端实时高斯溅射渲染 — tom_doerr · 2026-08-10
- 字节跳动提出 Modular TTT:将测试时训练模块化并系统消融 — ByteDance-Seed · 2026-08-10
- 字节发布抖音多模态嵌入模型,已上线搜索业务 — ByteDance · 2026-08-10