Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction
Dahyun Chung, Siyoon Jin, Hyunwook Choi, Honggyu An, Junyoung Seo, Hyunsung Kim, Seung Wook Kim, Seungryong Kim
cs.CV, cs.AI
2026-10-09
KAIST 提出 ME-World,把两路第一人称视频放进同一条去噪序列,用共享动作与场景记忆对齐交互,真实基准上环境一致性 0.468、状态更新一致性 0.466。
第一人称世界模型按动作预测下一步看见的画面。已有模型大多只有一个自我:自己的手、自己的头、自己的下一帧。多人 VR 和具身仿真里,两个人待在同一个会变的场景中。甲伸手去拿锅,自己镜头里手要到位,乙的镜头里甲的身体和锅的新位置也得同时改掉。
现有多智能体世界模型把动作收成走路、相机轨迹或离散指令。粗控制能让多视角大致对齐,撑不起手、手臂、身体姿态和转头。缺口是三件事,图 2 各有一个反例:跨视角动作要对上;布局、外观和物体不能两路各画各的;交互改过的状态要写进每一路视频。
ME-World 从 Cosmos-Predict2.5 2B 微调,VAE 和文本编码器冻结,只更新 DiT 与条件模块。真实数据与合成数据分开训。公式按 N 人写,实验是两人。输入是双方未来的头动与身体动作、文本、首帧和共享历史观测,输出两路未来第一人称视频。
优化用 rectified flow。AdamW,学习率 3e-5,全局 batch 4,四张 A100。推理 35 步,guidance scale 7.0。动作是给定的,模型不规划下一步。
真实视频来自 CoMind 的双人同步第一人称。合成数据把 Inter-X 与 InterHuman 共 1822 段双人动作重定向到 100 个虚拟人、7 个场景、53 个摆放,得到 4736 对 77 帧片段,504×504、10 FPS。
一致性用 DINOv3 特征的余弦相似度。共视点由真值深度和真值相机建立,重投影深度差超过 10 厘米就丢掉。Senv 只看历史 warp 盖不住的新区域。Supdate 只看相对历史已经改变、且有 warp 依据的区域。Sid 只在合成角色上算:SAM3 抠出对方,与 12 个方位的参考图取最大相似度。
表 1 的公开模型不在这套数据上微调。多视角方法还使用另一路真值视频。旋转误差和 FVD 都是越低越好。
| 方法 | 数据 | Senv | Supdate | 旋转误差 | 全身 PCK@10 | FVD |
| ME-World | 真实 | 0.468 | 0.466 | 2.256 | 0.881 | 637.9 |
| GEN3C | 真实 | 0.417 | 0.412 | 12.376 | 0.456 | 1358 |
| LingBot-World | 真实 | 0.329 | 0.284 | 13.173 | 0.243 | 689.9 |
| ME-World | 合成 | 0.441 | 0.436 | 9.057 | 0.644 | 465.5 |
| LingBot-World | 合成 | 0.249 | 0.210 | 29.962 | 0.090 | 841.5 |
真实数据上还有平移误差 0.042、Hand-F1 0.888、Hand-mIoU 0.531、全身 F1 0.822、PSNR 19.849、LPIPS 0.289。GEN3C 有真值参考流,手部 mIoU 仍只有 0.087。LingBot 的 FVD 689.9 接近 637.9,房间和对方姿态差一截。合成 Sid 为 0.561,次高 JointControlVideo 是 0.518。合成 Senv 0.441,对照 GEN3C 的 0.414,差距比真实数据更窄。合成旋转误差 9.057,明显高于真实的 2.256。
同一骨干、同一数据和同一套共享动作条件下,改编版 MetaWorld 的 Senv 0.421、Supdate 0.413、旋转误差 4.086、Hand-mIoU 0.379、全身 PCK 0.787、FVD 704.4。ME-World 对应为 0.468、0.466、2.256、0.531、0.881、637.9。全身 F1 两边是 0.816 和 0.822,几乎贴住。Solaris 与 γ-World 的全身 F1 掉到 0.146 和 0.188。
消融在真实数据上。只微调 Cosmos,Senv 停在 0.290。加上手部骨架和历史 warp,Senv 到 0.401,FVD 558.6。共享动作把对方全身 PCK 从 0.416 拉到 0.809,FVD 却从 554.7 升到 651.9。满配 FVD 637.9,不如联合生成加环境记忆、不加共享动作的 541.7。
三人与 221 帧只有定性演示,没有一致性数字。加第三人是再拼一路 token;长序列按块接,下一块条件取上一块末尾 1 到 2 帧。
给定两人未来的身体和头部位姿,一次采样出对得上的第一人称。2B 骨干,四张 A100、batch 4 可以微调。
相对没微调的 GEN3C,全身 PCK 从 0.456 到 0.881,对方没在 CoMind 上训过,差距里混着域差。相对同一设定的 MetaWorld 改编版,Senv 0.468 对 0.421,旋转误差 2.256 对 4.086,是同一条路线上的改进。动作仍由外部给定,还不能拿来做闭环规划。
主实验按 77 帧的双人片段评。三人与 221 帧没给一致性分数,只能说明 token 拼得上去。人数和时长一加,联合注意力的序列就变长,论文把更大规模留给更高效的通信和记忆。
表 1 的帧数和条件没有对齐:GEN3C 先垫到 121 帧再截回 77 帧,EgoSim 只出 61 帧。表 2 的改编版都借用了共享动作条件,比较的是通信方式和场景记忆。MetaWorld 无官方实现,按论文重写。
Senv 和 Supdate 只回答共视区域像不像,而且对应点依赖真值深度和真值相机。抓没抓住物体,这两个分数都不知道。Sid 测不到真实的人。历史覆盖不足时会掉多少,论文没有曲线。满配的 FVD 还差于更瘦的消融,对齐更好不等于更像真值视频。35 步去噪加上重投影,离实时多人仿真还远。