把手位置解开铰链歧义,Segment-Snap把运动AP从13.74拉到40.98

Geometric and Semantic Coupling for Interaction Understanding in 3D Scenes

Hanyang Kong, Xingyi Yang

cs.CV, cs.AI

2026-09-22

新国立与港理工的Segment-Snap用预测把手选铰链侧,不动训练运动回归头,就把Articulate3D验证集运动AP从13.74推到40.98;挑战赛运动与把手两项公开第一。

这篇在解决什么

要在静态三维场景里交互,只认出「这是柜门」不够。还得知道哪块能动、绕哪条轴动、手该抓哪一小块。柜门很大,把手可能只有几个点;同一扇关着的门,铰链在左在右从表面看都说得通。更好的部件掩码不会自动给出更好的运动,准的把手位置也不会单独告诉你这是旋转还是平移。

Articulate3D把这三项标在ScanNet++重建上。USDNet一类方法联合预测部件、可交互区域和运动,但运动头并不拿检测出来的把手去选铰链。Segment-Snap走互补的一条:部件和把手有物理绑定,把这个关系写成一次、单向的信息传递。

方法

三套独立训练的Volt-B体素Transformer吃同一份带法向的RGB点云。部件预测器给出可动表面和旋转/平移类,不回归轴。稠密把手预测器做点级分类再连通域成实例,位置拿去导运动。联合预测器在自己的部件query上解码子掩码,只把它的把手候选并入最终集合。

运动解码是训练免费的几何规则。对每个部件掩码取最大连通域,拟合平面最小面积矩形。旋转轴用世界竖直先验,平移轴用盒子最薄方向。在0.5米内找最近把手质心,在四个与轴平行的候选铰链里选离把手最远的那条,原点投到该线上。没有把手就退回支撑质心。水平铰链和倾斜机构是这条先验的盲区,不是把手能补上的。

反向传递只改联合模型多出来的那些把手的类别:被高置信部件以≥0.9包含就采用部件类,否则用稠密把手回退。掩码和分数不动,稠密检测整条不改。最终把手不回灌进运动解码,没有迭代。

结果

在42个公开验证场景上,固定掩码、类别、分数和轴,只把原点从质心改成把手引导的铰链,运动门控AP从13.74到40.98(+27.25)。增益全在旋转部件:1.88到56.37;平移原点本来就不计分,所以是0。追加联合模型的子把手让把手AP从24.63到29.65;仅用部件改类再+0.98,完整规则到30.99。参考配置的部件AP为47.93。

和USDNet发表数字比,部件更高、把手接近(30.99对31.1),但场景名单、训练资源和评测实现没有对齐,只能当背景。

冻结部件特征上,训练免费规则40.98,最接近的学习选择头三粒种子最高39.36,配对区间穿过零,写不成「规则赢过学习头」。随机打乱或乱生成的子掩码加不上分;真的子候选在稠密已匹配的140个真值之外又找回53个。

公开测试集(队名TnG)运动AP₅₀AO 48.28、把手AP₅₀ 34.46,两项都是当时公开榜第一,第二名运动40.56、把手32.86。测试标注不公开,机制消融全在验证集,且模型选择看过验证运动AP。

为什么重要

3D交互理解里,「再训一个运动头」不是唯一出路。把手在哪,往往已经足够解开直立门的铰链侧。对要进仿真或操作的系统,这是低成本的几何归纳:轴和原点来自拟合和规则,学习部分集中在「找得到部件和把手」。把手AP的提升更小、更不稳,主菜是运动。

局限与存疑

解码假定部件近似平面、转轴近似竖直。缺把手、碎掩码、邻域把手被误关联,都会把铰链放错。类校正跨训练种子波动大(0.19到1.34),不能把参考配置的+1.34当成稳定份额。子候选增益证明的是多一个提案源,没有单独证明「父query条件化」本身。验证集既做开发又做消融,不是未碰过的泛化估计。水平铰链那12例,把手帮不上轴先验。

术语

原文与代码

相关论文

全部论文解读