无需训练的生成渲染方法修复回访场景不一致
Wenchao Ma · hf · 2026-07-27
- 这篇工作针对自动回归式生成渲染中的一个问题:camera 回到旧位置时,模型会把同一场景重新生成得不一致。
- 原因在于长时序生成依赖有限的 KV cache,早先上下文会被挤掉。
- 作者提出一个无需训练的办法,直接利用 3D 引擎本就能提供的对应关系。
- 其中,时间对应会把姿态匹配的历史 latent chunk 取回 KV cache 作为 loop-closure memory;空间对应则借助相机位姿和深度重投影,把注意力偏向几何上对应的位置。
- 在从 TartanAir 和 TartanGround 中挖掘的 loop-closure 轨迹上,它在提升 revisit consistency 的同时,没有牺牲整体视频质量。
「研究」频道最新
- CellType 在 YC Startup School 展示生物世界模型 — david_van_dijk · 2026-07-27
- SceneActBench 评测 VLM Agent 是否能在完整 3D 场景中行动 — Yifei Zhao · 2026-07-27
- 腾讯混元梳理原生多模态预训练的缩放规律 — Tencent-Hunyuan · 2026-07-27
- NVIDIA 开源 Molt:面向 Agentic 强化学习的训练框架 — nvidia · 2026-07-27
- Skill Self-Play 用共进化技能提升 LLM 能力上限 — QwenBusinessUnit-Edu · 2026-07-27
- VisCo 复用预训练 VLM,实现更强的视觉 token 压缩 — Yupeng Zheng · 2026-07-27