像素对齐规范坐标图替代稀疏位姿,布局3D-IoU比SAM3D高四成

Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene

Yang-Tian Sun, Tianjia Liu, Zehuan Huang, Yi-Hua Huang, Xiaoyang Lyu, Ziyi Yang, Zi-Xin Zou, Yuan-Chen Guo, Yan-Pei Cao, Xiaojuan Qi

cs.CV, cs.GR

2026-09-21

港大与VAST用有界规范坐标图对齐单目点云来恢复物体摆放,不再回归稀疏位姿。BlendSwap上3D-IoU从SAM3D的0.520升到0.727,训练只用约6万公开物体。

这篇在解决什么

单图已经能生成还像样的物体网格,难的是把这些物体放回同一套场景坐标。整体生成把摆放吞进场景级过程,物体细节被摊薄。组合式方法把几何和布局拆开,布局却常被写成平移、旋转、尺度三个稀疏无界变量。场景级 3D 标注又少,网络很难把这几个数回归准。SAM3D 这类靠大规模数据引擎的系统,布局仍然走稀疏位姿,对齐精度有限。

港大与 VAST 的判断是:数据堆上去也补不齐这个表示问题。该换布局怎么写。

方法

Mira-Scene 的核心是 Canonical Coordinate Map(CCM)。物体先归一化到有界规范空间。CCM 是一张像素对齐的三通道图,物体 mask 里每个可见像素存的是该表面点在规范空间里的 xyz,不是颜色。另用单目几何模型估计场景点云图 Point Cloud Map(PCM)。把裁剪坐标系下的 CCM 贴回全图,每个有效像素就给出一对规范坐标 ↔ 场景点。物体到场景的相似变换用 RANSAC 加 Umeyama 闭式解从这些对应里估,不再让网络直接回归位姿。

几何和 CCM 都活在同一套规范空间,所以用 Mixture-of-Transformers 一起生成:几何专家在体素潜空间里走 rectified flow,布局专家在像素空间生成 CCM,两条流通过共享自注意力交换信息,再用共享三维位置编码把布局 token 放到 z=zlayout 的平面上。几何条件来自全图 DINOv2、物体 mask 和裁剪图。

训练分两段。先在约 6 万个物体、100 万张物体中心渲染上预训练,外加 2 万张补了背景的照片级视图。CCM 不需要场景级布局标注。再在 2 万张 3D-FRONT 场景视图上微调,专门适应遮挡和部分可见。定量实验统一用真值 instance mask,公平比较布局,不用把分割误差算进来。

结果

对照 Gen3DSR、MIDI、SceneGen、SAM3D,同一张 RGB 和同一套 mask。

方法BlendSwap 3D-IoUBlendSwap 2D-IoU3D-Future 3D-IoU
MIDI0.2290.4720.280
SceneGen0.1850.3940.446
SAM3D0.5200.6720.596
Mira-Scene0.7270.7830.694

相对 SAM3D,BlendSwap 上 3D-IoU 相对提高 39.8%,2D-IoU 提高 16.5%。几何上 BlendSwap 的 Chamfer Distance 是 0.021 对 SAM3D 的 0.027;3D-Future 上 SAM3D 的几何略好(CD 0.014 对 0.015)。赢面主要在布局。

消融把同一套共生成骨架换成原始位姿回归或 Coord Cube(在场景空间预测规范网格点)。Coord Cube 的 3D-IoU 只有 0.379,CCM+PCM 到 0.727。去掉跨分支注意力后,几何–布局一致性的 2D-IoU 从 0.757 掉到 0.535。遮挡分组里,较完整可见物体 3D-IoU 0.752,重度遮挡 0.635。对应误差中位数 0.046,95 分位到 0.395,所以必须用鲁棒对齐。

为什么重要

对要可编辑场景、仿真或机器人交互的人,组合式资产比一整块场景网格好用。CCM 把布局监督搬到物体级渲染上,场景数据只承担遮挡适应。用公开的 6 万物体就能在布局上超过依赖更大数据引擎的 SAM3D,说明表示选对了,比单纯堆场景标注更划算。

局限与存疑

附录写了三条。物体独立生成,靠得太近或网格不准时会自交,比如猫尾巴穿进椅子。输入依赖 mask,复杂场景里噪声 mask 会引出漂浮碎片;定量表用的是真值 mask,野外效果会差一截。全局几何交给单目估计,卡通图有时会得到薄片状点云,布局跟着塌。重度遮挡时 3D-IoU 已经掉到 0.635,遮挡补全仍是弱项。

术语

原文与代码

相关论文

全部论文解读