字节把室内物体摆位做成VLM拧gizmo,场景F-Score到0.924

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

cs.CV, cs.AI

2026-08-31

字节跳动Lucida把室内实景做成可编辑物体资产:先建带多视证据的场景图,再补全遮挡资产,最后让VLM策略GizmoAct在三维编辑器里拧gizmo闭环摆位。场景F-Score从SAM 3D的0.794升到0.924。

这篇在解决什么

机器人仿真和具身智能需要的是能单独搬动物体的房间副本,不是一整块NeRF或3DGS。现有管线仍按「解析、生成、摆回去」三步走,但每一步都预设了杂乱室内拍不到的输入:干净实例几何、无遮挡视角、和观测严丝合缝的资产。解析要精确mask,生成要居中特写,位姿估计要资产和深度对得上。任何一步达不到,后面全废。

Lucida保持这个顺序,但把精度要求挪到最后。前两步只吃真实采集可靠给出的东西,闭环摆位再把误差收干净。

方法

输入是带位姿的室内RGB-D序列。解析阶段先按共视和时序抽关键帧,用VLM发现物体、3D检测器出框,再把物体证据扩到全序列,并按支撑、包含、邻接关系修场景图。每个节点带着证据包:多视图像、部分点云、粗3D框、指代描述。

生成阶段不拿残缺点云做补全。它从证据包里挑互补视角,用Set-of-Mark标出目标,让图像编辑模型合成一张无遮挡的物体图,再由图像到3D模型抬成完整资产。

摆位是这篇的核心。GizmoAct把9自由度对齐做成多轮GUI操作:画面里叠着场景点云、资产、黄框和红绿蓝gizmo。策略每步只输出一个可执行编辑,平移和缩放都按当前物体尺寸计量,从不回归绝对位姿或米制尺度。大旋转先用switchobs看六面,再permuteaxis一次做完24种轴对齐重定向里的一种,剩下的用updatepose修。停不停由策略自己判断。训练先在合成专家轨迹上做监督微调,轨迹里会注入错误再示范恢复;再用GRPO在同一可执行环境里强化学习,奖励按3D IoU和测地旋转误差分四档,两边都到成功带才给分。对称物体不进RL,因为旋转误差会惩罚等价姿态。

结果

三层评测分开报,避免上游检测误差污染摆位数字。

任务指标Lucida最强基线
R2S-Scene检测mAP (all)0.592Boxer 0.351
CA-1M位姿[email protected]83.4%RecGen 57.8%
R2S-Object位姿[email protected]92.0%RecGen 79.2%
R2S-Scene重建场景F-Score0.924SAM 3D 0.794
R2S-Scene重建场景CD0.010SAM 3D 0.022

GizmoAct最多用4个视角、最多12步。同一套策略能接Boxer、Any6D式深度+mask、SAM 3D三种初始化,不必重训。消融里,几何感知关键帧换成均匀采样,mAP从0.597掉到0.516,场景F-Score从0.831掉到0.727。RL相对SFT主要吃掉大旋转残差:困难子集上旋转误差从45.19°降到20.98°。

为什么重要

这是一条能从真实室内视频直接出仿真就绪、可逐物体编辑场景的管线。把摆位做成VLM拧gizmo,等于承认生成资产和观测对不齐是常态,用闭环交互去消化几何误差,而不是要求上游一次给对。做real-to-sim、室内数字孪生或具身数据合成的人可以按这个接口接自己的资产生成器。

它仍是渐进工程:解析、生成、摆位都建立在现成VLM、检测器和图像到3D模型上,创新主要在任务改写和闭环策略。

局限与存疑

解析阶段漏掉的物体,后面生成和摆位救不回来。闭环目前只作用在最后一步,解析和生成还是开环。RL排除了对称物体,奖励也不看纹理,外观才能区分的朝向测不准。主对比里的GizmoAct对Boxer初始化做过特化,换初始化会掉点。R2S是自建室内基准,场景数量有限,跨数据集泛化没有单独报。位姿评测用的是人工对齐过的生成资产,系统级误差会比这张表更大。

术语

原文与代码

相关论文

全部论文解读