World in World:免训练操控冻结视频世界模型实现重机位与回访
udmrzn · x · 2026-09-13
arXiv 论文《World in World》提出一种免训练的推理时接口,可在不重训冻结视频世界模型的情况下实现灵活控制。
核心思路:
- 将源视频观测、目标视角场景投影、引导补全新暴露区域的几何渲染、以及超出滚动缓存的可检索生成状态,统一转换为带相机和时间标签的「视觉证据 K/V」
- 通过对应关系路由器(correspondence router)结合持久点身份与几何建立 token 对应,引导 query 匹配源视频 token
- 证据级注意力 CFG(EWA)在同一次去噪前向中独立调节每个辅助通道的贡献
支持的能力包括:相机控制的重渲染、长时程一致性回访(重访先前生成的外观)、以及人体运动相关的任务,全程利用冻结因果视频模型的原生自注意力。
所属事件:World in World 免训练为冻结视频世界模型赋予灵活控制(2 条相关)→
「多模态」频道最新
- 不会建模的美术总监用 GPT + Blender MCP,45 分钟从零建出医院走廊 — Time-Ad-7720 · 2026-09-13
- Narrative 发布:用提示词驱动 Agent 的平民化 AI 视频编辑器 — Scobleizer · 2026-09-13
- 一张图两种画风:旅行明信片级写实+水彩双风格提示词模板 — nikola_mr64990 · 2026-09-13
- 胡渊鸣发布 Mora 1:代码+3D 生成+实时视频打造 AI 原生游戏 — fredodurand · 2026-09-13
- 设计师求荐:logo 头脑风暴用哪些生成式工具 — RileyRalmuto · 2026-09-13
- 超现实 AI 音乐视频《The Jitterbug Jamboree》 — Hellish_NDE · 2026-09-13