京东 EchoWM 用统一 6-DoF 相机意图走进 720p 带声世界

EchoWM: Open and Enterable Omnimodal World Models

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

cs.CV

2026-08-24

京东等提出 EchoWM,把离散按键和连续位姿映射成同一套相对 6-DoF 轨迹,同时生成 720p 视频、环境声与语音。WBench Navigation 均分 81.7,高于 HiDream-O1-World 的 80.9。

这篇在解决什么

现有世界模型大多只会出无声画面,交互还绑在特定手柄或相机架上。游戏侧吃 WASD,相机可控视频吃 Plücker 射线,两边很难共用一套条件。音频经常是画面生成后再配,走进场景时听不到脚步、碰撞和对话,空间反馈缺一块。

EchoWM 把目标收成可走进的全模态世界:给定参考画面和结构化场景描述,用户持续导航,模型同时吐出 720p 视频、环境声、音乐和语音,并且能多轮续写。工作来自京东 Joy Future Academy,合作方包括港科大、北大、港大、清华和斯坦福。

方法

核心接口叫 camera intent。第一人称里,这条轨迹就是观察者自己在动;第三人称里,同一条轨迹交给模型去学角色怎么走、镜头怎么跟。模型看不到角色轨迹、手柄状态或相机架参数,只看相对 6-DoF。

离散按键和连续位姿都先变成相对初始帧的 SE(3) 位移。跨数据集的尺度用训练集上每条 clip 最大平移的 90 分位做全局标定。逐 clip 归一化会抹掉位移幅度,相邻 chunk 的速度也会跳。几何注入走 Unified Camera Positional Encoding:相对射线几何直接进视频 self-attention 的一条并行分支,零初始化,起步不搅预训练通路。音频不直接吃轨迹,声音只通过原有跨模态耦合跟着画面走。

数据来自四路,很少在同一源里凑齐外观、自然音频、可交互运动和可靠几何:

处理后拆成三份混合物。AV-rich 给视听先验,不要求可靠轨迹;control-clean 给干净运动,文中抽了 28,605 条看覆盖;两者高质量交集给联合微调。轨迹训练时删掉 narrative 字段,避免模型从文字里偷看镜头运动。发出的按键和实际相机轨迹被分开保存:角色被墙挡住时,前向指令可以几乎不产生位移,模型条件用的是实现出来的相机运动。

训练分四段。AV-CPT 在视听丰富数据上继续预训练整网,不加轨迹。Action-SFT 冻骨干,只训轻量轨迹分支。Joint-FT 用更低学习率一起更新。自回归后训练先用 teacher forcing 把双向扩散改成因果 chunk,再做短程和长程 Self-Gradient Forcing,并用 Distribution Matching Distillation 压成四步采样。长程用 sink-plus-FIFO 限制 KV,不另建检索记忆。蒸馏后的因果版叫 EchoWM-Flash。

这套接口只管导航和视点。跳跃、攻击、操作物体不在表示范围内。

结果

公开榜数字清楚。

设置EchoWM最强或最近对照
WBench Navigation 均分(158 例)81.7HiDream-O1-World 80.9
同上 Interaction87.2;Flash 87.9HY-World 1.5 AR-distill 86.8
同上 Consistency89.8LingBot-World base-camera 89.9
SANA-WM-Bench 短程 Simple VBench83.91SANA-WM 81.75
长程 Simple 旋转误差3.22°SANA-WM 7.59°
长程 Simple 重访 PSNR15.10 dBSANA-WM 14.16 dB

Genie 3 在同一 Navigation 拆分上均分 73.9。Flash 均分 81.0,蒸馏后整体掉 0.7,交互分反而高 0.7。短程 Hard 上 SANA-WM 旋转误差更低,1.248° 对 EchoWM 的 1.697°,EchoWM 赢在画质(83.96 对 81.79)。长程 Hard 旋转误差涨到 12.05°,累积漂移仍是主病。Flash 在 961 帧因果协议上 Simple VBench 80.13、旋转 5.009°,对照 Evoke 为 80.11 和 9.859°。

自建 200 例主观评测覆盖游戏、人形机器人、室外、室内和驾驶,第三人称 132、第一人称 68。相对 LingBot-World-v2 总体偏好 46.50% 对 21.57%,相对 HappyOyster 63.13% 对 27.06%。运动维度经常双方都差;对 HappyOyster,语义跟随 EchoWM 只拿 13.63% 的票,对方 29.44%。训练混合物里没有 2D/2.5D 游戏和机器人数据,定性例子显示这些域也能跟视点,但没有定量对照。

为什么重要

如果目标是可玩的生成世界,这篇把交互从手柄语义抽到观察意图,第一、第三人称不用两套控制器。视听是原生联合生成,不是后期配音。Flash 说明四步因果蒸馏能保住大部分导航分数。能用的场景停在导航和看点控制,别拿它当游戏引擎。

领先幅度在公开均分上只有零点几分,更硬的证据在长程平移误差、重访一致性和因果版的轨迹跟随。

局限与存疑

作者写得很清楚:接口覆盖不了跳跃、攻击、操作物体或机器人指令,也没有碰撞状态和确定性转移。没有显式持久 3D 记忆,几何、身份、世界状态和音频会在多轮续写里漂。全局平移过滤把过大位移丢掉了,更大平移、更高速度、怪异旋转没有验证。互联网和游戏视频的位姿即使用 ViPE、VGGT-Omega 和 MoGe-2,仍会跟内容和运动模糊相关。

音频没有单独的动作到声音监督,论文也不声称有。主观评测里运动质量和部分语义跟随并不占优。WBench 为了开域打分会适配轨迹尺度,绝对位移幅度要靠自建速度响应实验看,正文只给了定性接近镜头的对比。

术语

原文与代码

相关论文

全部论文解读