双人第一人称联合去噪,真实场景环境一致性0.468

Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction

Dahyun Chung, Siyoon Jin, Hyunwook Choi, Honggyu An, Junyoung Seo, Hyunsung Kim, Seung Wook Kim, Seungryong Kim

cs.CV, cs.AI

2026-10-09

KAIST 提出 ME-World,把两路第一人称视频放进同一条去噪序列,用共享动作与场景记忆对齐交互,真实基准上环境一致性 0.468、状态更新一致性 0.466。

这篇在解决什么

第一人称世界模型按动作预测下一步看见的画面。已有模型大多只有一个自我:自己的手、自己的头、自己的下一帧。多人 VR 和具身仿真里,两个人待在同一个会变的场景中。甲伸手去拿锅,自己镜头里手要到位,乙的镜头里甲的身体和锅的新位置也得同时改掉。

现有多智能体世界模型把动作收成走路、相机轨迹或离散指令。粗控制能让多视角大致对齐,撑不起手、手臂、身体姿态和转头。缺口是三件事,图 2 各有一个反例:跨视角动作要对上;布局、外观和物体不能两路各画各的;交互改过的状态要写进每一路视频。

方法

ME-World 从 Cosmos-Predict2.5 2B 微调,VAE 和文本编码器冻结,只更新 DiT 与条件模块。真实数据与合成数据分开训。公式按 N 人写,实验是两人。输入是双方未来的头动与身体动作、文本、首帧和共享历史观测,输出两路未来第一人称视频。

优化用 rectified flow。AdamW,学习率 3e-5,全局 batch 4,四张 A100。推理 35 步,guidance scale 7.0。动作是给定的,模型不规划下一步。

结果

真实视频来自 CoMind 的双人同步第一人称。合成数据把 Inter-X 与 InterHuman 共 1822 段双人动作重定向到 100 个虚拟人、7 个场景、53 个摆放,得到 4736 对 77 帧片段,504×504、10 FPS。

一致性用 DINOv3 特征的余弦相似度。共视点由真值深度和真值相机建立,重投影深度差超过 10 厘米就丢掉。Senv 只看历史 warp 盖不住的新区域。Supdate 只看相对历史已经改变、且有 warp 依据的区域。Sid 只在合成角色上算:SAM3 抠出对方,与 12 个方位的参考图取最大相似度。

表 1 的公开模型不在这套数据上微调。多视角方法还使用另一路真值视频。旋转误差和 FVD 都是越低越好。

方法数据SenvSupdate旋转误差全身 PCK@10FVD
ME-World真实0.4680.4662.2560.881637.9
GEN3C真实0.4170.41212.3760.4561358
LingBot-World真实0.3290.28413.1730.243689.9
ME-World合成0.4410.4369.0570.644465.5
LingBot-World合成0.2490.21029.9620.090841.5

真实数据上还有平移误差 0.042、Hand-F1 0.888、Hand-mIoU 0.531、全身 F1 0.822、PSNR 19.849、LPIPS 0.289。GEN3C 有真值参考流,手部 mIoU 仍只有 0.087。LingBot 的 FVD 689.9 接近 637.9,房间和对方姿态差一截。合成 Sid 为 0.561,次高 JointControlVideo 是 0.518。合成 Senv 0.441,对照 GEN3C 的 0.414,差距比真实数据更窄。合成旋转误差 9.057,明显高于真实的 2.256。

同一骨干、同一数据和同一套共享动作条件下,改编版 MetaWorld 的 Senv 0.421、Supdate 0.413、旋转误差 4.086、Hand-mIoU 0.379、全身 PCK 0.787、FVD 704.4。ME-World 对应为 0.468、0.466、2.256、0.531、0.881、637.9。全身 F1 两边是 0.816 和 0.822,几乎贴住。Solaris 与 γ-World 的全身 F1 掉到 0.146 和 0.188。

消融在真实数据上。只微调 Cosmos,Senv 停在 0.290。加上手部骨架和历史 warp,Senv 到 0.401,FVD 558.6。共享动作把对方全身 PCK 从 0.416 拉到 0.809,FVD 却从 554.7 升到 651.9。满配 FVD 637.9,不如联合生成加环境记忆、不加共享动作的 541.7。

三人与 221 帧只有定性演示,没有一致性数字。加第三人是再拼一路 token;长序列按块接,下一块条件取上一块末尾 1 到 2 帧。

为什么重要

给定两人未来的身体和头部位姿,一次采样出对得上的第一人称。2B 骨干,四张 A100、batch 4 可以微调。

相对没微调的 GEN3C,全身 PCK 从 0.456 到 0.881,对方没在 CoMind 上训过,差距里混着域差。相对同一设定的 MetaWorld 改编版,Senv 0.468 对 0.421,旋转误差 2.256 对 4.086,是同一条路线上的改进。动作仍由外部给定,还不能拿来做闭环规划。

局限与存疑

主实验按 77 帧的双人片段评。三人与 221 帧没给一致性分数,只能说明 token 拼得上去。人数和时长一加,联合注意力的序列就变长,论文把更大规模留给更高效的通信和记忆。

表 1 的帧数和条件没有对齐:GEN3C 先垫到 121 帧再截回 77 帧,EgoSim 只出 61 帧。表 2 的改编版都借用了共享动作条件,比较的是通信方式和场景记忆。MetaWorld 无官方实现,按论文重写。

Senv 和 Supdate 只回答共视区域像不像,而且对应点依赖真值深度和真值相机。抓没抓住物体,这两个分数都不知道。Sid 测不到真实的人。历史覆盖不足时会掉多少,论文没有曲线。满配的 FVD 还差于更瘦的消融,对齐更好不等于更像真值视频。35 步去噪加上重投影,离实时多人仿真还远。

术语

原文与代码

相关论文

全部论文解读