World in World:免训练操控冻结视频世界模型实现重机位与回访

udmrzn · x · 2026-09-13

arXiv 论文《World in World》提出一种免训练的推理时接口,可在不重训冻结视频世界模型的情况下实现灵活控制。

核心思路:

支持的能力包括:相机控制的重渲染、长时程一致性回访(重访先前生成的外观)、以及人体运动相关的任务,全程利用冻结因果视频模型的原生自注意力。

所属事件:World in World 免训练为冻结视频世界模型赋予灵活控制(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →