ReWorld 用 12 块缓存记住一分钟前的场景,旋转误差 11.95°

ReWorld: An Interactive World Model with Long-Horizon Memory

Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

cs.AI

2026-08-25

交互世界模型把控制和记忆拆到不同注意力窗口,推理用位姿地标填固定 KV。旋转误差 11.95°,约 64 秒来回仍能回到起点,滑窗和全 KV 做不到。

这篇在解决什么

交互式世界模型要同时跟手、记得去过的地方、还能实时往外流。矛盾写在结构里:控制只需要短窗口,记忆需要看不到边的历史。现有系统把两者绑在同一套注意力上,加动作注入会抬控制、掉回访保真。ReWorld 训练时把窗口拆开,推理时用固定 KV 预算把记忆收住。

方法

骨干是 Wan2.2-TI2V-5B,切成因果 chunk 流式生成。两路条件:MRoPE 把相机位姿编进注意力相位,让相近视角在时间上再远也能对上;Plücker 射线图把当前指令加到 patch 嵌入。24 个头里 18 个只看最近 12 帧,6 个看全历史;每步从 12 组随机划分里换谁当全局头,避免能力绑死在固定头上。推理缓存固定 12 个 chunk:1 个 sink、5 个最近、6 个按位姿取回的地标。滑出窗口的 chunk 按里程计写入最多 30 条的地标库,满了就丢掉位姿最冗余的成员。训练时随机丢掉过去 chunk,让稀疏缓存变成训练分布。四步 DMD LoRA 压采样,控制通路不挂 LoRA,同一骨干可切高质量多步和实时。数据 220724 条带位姿片段,八个来源对齐到同一物理尺度,UE 上 20% 窗口做成回文轨迹,专门喂回访。

结果

40 张起始图 × 6 条轨迹共 240 条对照。整体旋转误差 11.95°,优于 LingBot-World 的 12.59°,相机运动一致性最好。VBench 七项均值 0.850,略高于 Yume-1.5 的 0.844。长程回访在 k=96(约 16 秒)上 SSIM 0.384、DINO 0.932,路径长度 615 px;HY-WorldPlay 分数更高,但出站路径只有 210 px,短路径更好记。消融里 chunk-drop 加随机头路由把 k=384(约 64 秒)的回访 SSIM 从 0.3387 拉到 0.3752;滑窗在同样预算下只有 0.3476,全 KV 在 k=288 起 OOM。动作注入相对纯 MRoPE 把 RotErr 从 17.66° 降到 13.21°,回访 SSIM 从 0.3898 掉到 0.3376;加上路由后控制仍在 12.94°,回访回到 0.3752。

方法旋转误差 ↓VBench 均值 ↑k=96 回访 SSIM
LingBot-World12.59°0.8410.251
HY-WorldPlay14.66°0.8420.427
ReWorld11.95°0.8500.384

为什么重要

可玩的世界模型卡在「跟手」和「还认得路」互相抢注意力。训练时按窗口拆能力、部署时按位姿取地标,是一套不必加新损失的工程解。固定 12-chunk 缓存撑到约一分钟的来回,全 KV 已经爆显存,这才是能上交互产品的形状。LoRA 蒸馏让同一 5B 骨干同时服务预览和实时。HY-WorldPlay 在短位移上回访分更高,比分数要一起看走了多远。

局限与存疑

回访协议用的是构造出来的回文轨迹,不是用户乱逛。HY-WorldPlay 在短路径上 SSIM/LPIPS 仍强,ReWorld 的记忆优势主要出现在窗口已经丢掉针的长度。控制基准用 ViPE 重跟踪再 Sim(3) 对齐,吃的是轨迹形状,不是绝对米制精度。VBench 被规范到 32 帧,不能直接跟各家原长度数字比。地标库容量 30、缓存 12,更长的开放世界是否够用,正文没有测。项目在阿里实习期间完成,数据管线偏 UE 渲染。

术语

原文与代码

相关论文

全部论文解读