一个模型统一四类 3D 部件分割,粗粒度 mIoU 领先基线 34.5

PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation

Zhe Zhu, Yiheng Zhang, Peng Li, Zixing Zhao, Honghua Chen, Yaqing Zhang, Le Wan, Zhiyang Dou, Cheng Lin, Yuan Liu, Mingqiang Wei, Wenping Wang

SIGGRAPH Asia 2026 (ACM Transact

cs.CV, cs.GR

2026-09-22

PartLLM 把 3D 部件分割统一成 LLM 自回归生成,单一模型四类设置全面超越专用基线,最高领先 34.5 mIoU。

这篇在解决什么

3D 部件分割把网格或点云拆成语义部件(椅背、剑柄),是资产编辑、角色 rigging、机器人抓取共同的前置步骤。现状是任务割裂:PartField 一类只输出无语义的几何块;FIND3D、CoSMo3D 按用户给的文字找部件,不会自己决定整个物体怎么拆;PartSAM、P3-SAM 做点选交互,输出同样不带名字。论文的 Table 1 摆出八个代表方法,没有一个同时覆盖点交互、文字引导、类别无关分解和语义全形状分解。

割裂的代价不只是接口麻烦。不同数据集观察的是同一套部件组织的不同侧面:有的只标被查询的部件,有的只有无标注区域,有的给完整分解,分开训模型等于让这些监督互相隔离。论文再进一步:部件分割天然多义,同一把剑拆两段还是拆十几个部件取决于意图,所以它该被建成条件生成问题,而非有唯一答案的判别问题。

方法

PartLLM 建在 Qwen3VL-4B 上,分两步:先让 MLLM「说出」要拆哪些部件,再把每个点分给说出的部件。

训练用 next-token loss 加动态标签空间上的逐点交叉熵,48 张 H20 端到端训 5 个 epoch。323K 个形状(PartNeXt、3DCoMPaT200、PartVerse、75K 个 MLLM 自动标注的授权资产、无语义的 HY3D-Bench 子集)展开成 1.1M 条同格式样本,这是统一格式带来的数据红利。

结果

设置基准最强基线PartLLM
全形状(类别无关)PartNeXtPartField 42.756.7
全形状(类别无关)3DCoMPaT200 粗SAMPart3D 51.686.1
全形状(类别无关)HY3D-BenchPartSAM 40.568.3
文本引导PartNeXtCoSMo3D 37.978.7
文本引导3DCoMPaT200 细CoSMo3D 26.180.0
交互式多轮点击—一次点击最高领先 10.1,七轮最高 18.5

3DCoMPaT200 上 margin 最大:粗粒度比最强基线高 34.5,细粒度高 32.0。数量控制也真的可用,请求 2、5、10 个部件会得到逐步变细但语义仍连贯的分解。语义全形状分割(要求 mask 带对名字)没有现成对手,作者给 PartSAM、P3-SAM 外挂一个 MLLM 命名阶段来比:两段式基线从 mask mIoU 换到语义匹配指标要掉 17.5 到 23.6 个点,PartLLM 只掉 11.1 到 14.2,说明它的区域本来就长在自己生成的名字上。真实扫描同样领先:FAUST 全形状 72.2 对 PartSAM 的 55.3,AKBSeg 文本引导 54.8 对 PatchAlign3D 的 35.6。

消融里信息量最大的一组:把联合 softmax 换回 SAM 式独立二值 mask,文本和交互设置只小幅下降,全形状 mIoU 却从 74.2 掉到 62.9,竞争式分配的价值恰好在部件最多的地方。去掉部件假设里的粗 3D 框伤害最大,文本引导从 80.0 掉到 55.4,光有名字定位不了部件。数据组合消融显示四种监督互相迁移,全形状 mIoU 随数据逐个加入从 56.2 涨到 74.2。换十个采样种子,PartObjaverse-Tiny 上 78.5 ± 2.2;测试时随机旋转几乎无损(78.8 对 78.3)。

为什么重要

对 3D 内容管线,这是一个模型替换四个专用模型,部件名开放词表、粒度一句话控制,mask 直接当编辑手柄用,论文演示了换材质和结构编辑。更大的信号在方法层面:异构标注压进同一个 prompt-response 格式后,任务多样性本身成了 scaling 轴,曲线到 1.2M 样本还在涨,连无语义数据都让全部设置受益。这是任务定义层面的合并,不在单个 benchmark 上磨点。代价也明确:48 张 H20 的训练预算,推理延迟随部件数增长,部件不多时与基线相当(自报)。

局限与存疑

作者自己给出的失败模式:几何上认错物体类别时整个分解跟着错,把路由器看成床,就会在路由器拓扑上幻觉出床的子结构;prompt 里补上类别名可以修正。对生成为骨架的方法,这个失败模式是结构性的。

读下来还有几处要掂量。语义匹配指标 SA-mIoU 靠 GPT-5.5 判断部件名是否等价,匹配器虽与 Qwen 底座独立,判断边界仍由另一个 LLM 决定,而开放词表命名恰是 PartLLM 占便宜的地方。语义全形状设置本来没有可比基线,两段式对照是作者现拼的。75K 个训练资产由 MLLM 自动标注,质量没有单独评估。交互式对比里只有部分基线走多轮协议,其余只报 one-click,协议不完全对齐。真实世界扫描只有 FAUST 和 AKBSeg 两个小基准。

术语

原文与代码

社区讨论

相关论文

全部论文解读