HSImul3R 把人–场景重建送进物理引擎,穿模率从 69.5% 降到 22.9%

HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions

Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu

cs.CV, cs.RO

2026-03-17

南洋理工大学 HSImul3R 从稀疏视角重建人–场景交互,再用模拟器双向优化动作和几何。HSIBench 上易场景稳定交互率从 HSfM 的 10.52% 升到 53.68%,穿模率从 69.51% 降到 22.9%,动作还能转到 Unitree G1。

这篇在解决什么

从几张随便拍的图重建「人坐在椅子上」,看起来能过,丢进物理引擎却经常穿模、把椅子踢飞、人和物体最后各站各的。视觉上合理、力学上非法,这篇把它叫做 perception-simulation gap。现有路线是拆开的:DUSt3R、Gaussian Splatting 只管场景;4DHumans 一类只管人体;HSfM 等统一框架主要在图像空间对齐,不管重力和接触能不能在模拟器里站住。

南洋理工大学 S-Lab、ACE Robotics 和上海人工智能实验室的 HSImul3R,把物理模拟器当成监督信号,对人的动作和物体几何做双向优化,目标是稀疏视角或单目视频也能产出可仿真、可往人形机器人上搬的人–场景交互(HSI)。

方法

先各自重建再对齐。场景用 DUSt3R;人用 SAM2 跟踪,4DHumans 出 SMPL,ViTPose 出二维关键点,再做人–场景的 bundle adjustment。这一步仍常缺腿、破面、不封闭。于是对每个物体切出最清晰的一张图,用 image-to-3D 模型 MIDI 生成结构更完整的网格,再用接触 / 非接触损失把人和物体在三维里推开或贴上,减轻穿模。默认输入是 4 张未标定稀疏视角。

然后进模拟器做两轮。

单目视频把 DUSt3R 换成 MegaSAM,人体换成 TRAM,并假定场景静止、只有人在动。HSIBench 用 3 名志愿者(两男一女)、19 类物体、50 余段动作,16 机位同步拍了 300 个交互实例;伪真值来自多视 2DGS 和 SMPL。正向跟踪得到的动作经 GMR 重定向到 Unitree G1,再在 IsaacGym 里用扩散引导的强化学习训全身策略,最后用官方 SDK 上真机。

结果

在自建 HSIBench 上按交互复杂度分成易 / 中 / 难。和目前唯一可对的稀疏视角基线 HSfM 比:

方法易/中/难 Stability-HSI(%)穿模 SP-3D(%)W-MPJPE / PA-MPJPE
HSfM10.52 / 4.50 / 2.6669.515.02 / 2.79
V4(无 DSRO)29.56 / 16.62 / 5.17未报4.57 / 2.39
HSImul3R53.68 / 30.56 / 13.9222.94.09 / 2.17

Stability-HSI 要求重力站得住、场景稳住、接触还在。易场景从 10.52% 到 53.68%,穿模从 69.51% 降到 22.9%。难场景仍只有 13.92%。W-MPJPE 和 PA-MPJPE 越低越好,动作在模拟后也更贴近伪真值。

image-to-3D 一侧,MIDI 微调后重力稳定率从 79.19% 升到 91.50%,Chamfer Distance 从 0.198 降到 0.173,F-Score 从 81.95 升到 88.25;对照把 DSO 接到同一 MIDI 上,重力稳定率停在 87.23%。视角从 4 增到 16,易场景稳定率只从 53.68% 到 55.16%,穿模和稳定性几乎不吃视角数。LoRA rank 64,四张 A100 训 1800 step。真机展示是 Unitree G1 上的若干坐、靠交互,定量成功率没给。

为什么重要

对做具身和仿真数据的人,这篇把「重建看起来像」和「引擎里不炸」拆开测了,穿模率和稳定交互率必须分开报。模拟器当监督去微调生成式几何,比在图像损失上再加一项接触正则更直接,也能解释为什么只加 MIDI、不加 DSRO 的 V4 稳定率会掉回 29.56%。4 视角已经够用,继续堆相机收益很小,采集成本可以压在稀疏视角。

它还不是能从 YouTube 规模视频自动产仿真数据的方案。难场景稳定率 13.92%,作者自己写成功率不高。

局限与存疑

作者列了三条:复杂交互或超过三件物体时成功率明显掉;失败时人和物体经常各自站着,交互在模拟里丢了;微调后的 MIDI 同时吃原训练集和 HSIBench 的偏置,出域泛化受限制。单目分支假定场景静止。评测几乎全在自建集上,HSfM 是唯一外部方法对照,V1–V4 都是自家消融。Stability-HSI 的「有意义接触」如何自动判定,主文写得粗。真机只有定性视频,没有与仿真稳定率对应的实机统计。HSIBench 物体以椅、桌、沙发为主,19 类听起来多样,交互形态仍偏坐靠。

术语

原文与代码

社区讨论

相关论文

全部论文解读