SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan
cs.CV
2026-08-06
按问题语义动态挑选并分配 3D 模态给专长专家,在五个 3D 场景基准上达 SOTA,并证明固定堆叠所有模态反而掉点。
3D 场景理解(看懂一个房间的布局、物体、空间关系)是具身智能的基础。现在的多模态大模型(MLLM)把 RGB 视频、深度图、鸟瞰图(BEV)、点云、体素(voxel)等多种模态一股脑喂进去做融合。但不同问题偏好的模态不一样:问「毯子什么颜色」主要靠 RGB,问「沙发什么形状」更靠点云或体素这类几何模态。固定地把所有模态平等塞进去,无关模态反而引入噪声、稀释推理,有时多加模态还会掉点。
SmartMage 的思路是:先按问题语义挑相关的模态,再让专家各司其职。
SmartMage 用「全局到局部」两层自适应来编排模态,基于 Qwen3-VL-8B-Instruct。先把五种模态(RGB、深度、BEV、点云、体素)编码进统一嵌入空间。
第一层是 SMART(语义引导的模态自适应路由),当全局调度器:对每条指令,它综合三个信号决定该用哪些辅助模态。语义先验估计器(SPE)从指令文本预测模态偏好(「什么颜色」指向 RGB,「在哪」指向几何模态);语义相似度打分器(SSS)算文本和各模态摘要的对齐度;模态质量评估器(MQE)从特征激活的强度、稀疏度、稳定性估计每个模态靠不靠谱,退化模态会被降权。三个信号加权得路由分布,RGB 固定保留为主模态,其余按需补充。
第二层是 MAGE(模态感知门控专家),在 LLM 的 MoE 层里把 token 分配给模态专长的专家。它先预测每个 token 属于哪个模态,再用一个可学的「模态与专家」亲和矩阵把模态先验注入门控函数,引导 token 路由、促成分模态的专家特化。MoE 插在 LLM 的第 8、12、16、20、24、28 层,每层 8 个专家、top-2 路由。
训练用一组联合损失:语义对齐(拉近指令和相关模态、推远无关模态)、模态归因与专家校准(让路由和模态先验一致)、专家均衡(防止路由塌缩)。
在五个 3D 基准上达到 SOTA。3D 问答:ScanQA EM@1 为 32.6、SQA3D 为 66.8,分别比前 SOTA Ross3D 高 1.8 和 3.8。稠密描述:Scan2Cap [email protected] 为 88.7,比 Video-3D LLM 高 4.9。视觉定位:ScanRefer [email protected] 为 59.5、Multi3DRefer [email protected] 为 60.7,比 Ross3D 分别高 5.1 和 6.4。
消融验证了自适应选模态的价值。固定模态组合里,把五种全用上(表 4 第 10 行)反而不如少用几种(第 8 行在多个基准更高),印证了模态冗余和相互干扰;而 SmartMage 的自适应选择在全部基准上最优。去掉 SMART 里的语义相似度打分器(SSS)掉点最大(ScanQA 29.8 掉到 27.1),说明文本与模态对齐是路由的关键。
作者还建了一个诊断基准 ScanFacet,把问题分成八类语义(颜色、位置、材质、数量、形状、类型、空间关系、其他)。SmartMage 在各类上都涨,材质和颜色理解上 CIDEr 分别涨 27.1 和 15.9。可视化显示它确实学到了语义与模态的偏好:颜色和材质问题偏 RGB,空间和计数问题偏深度和体素。
效率上,训练每轮 47.4 秒,比 Video-3D LLM 和 Ross3D 快 2.0 到 2.6 倍;即使没有 3D 输入、只用 RGB 视频,在三个纯视频基准上仍有竞争力。
多模态融合长期默认「模态越多越好」,SmartMage 用数据反驳了这点,并给出一套按语义动态选模态、按模态分专家的可解释方案。对做具身感知、3D 与视频理解的人来说,这是把「该用哪个模态」从人工拍板变成模型自适应的可行路径,还顺带省了算力。
作者自述两点:受 LLM token 预算限制,多视角图像靠关键帧选择算法(FoVSR)抽取、点云用最远点采样降采样,可能漏掉关键视角或小目标的细粒度细节;模型效果受训练数据质量(模糊图像、标注不准)约束。读下来再补一点:ScanFacet 是作者自建的诊断基准,「语义与模态偏好」的结论部分依赖其分类口径,独立验证还需要社区跟进;纯 RGB 视频基准上仍略输给专门的视频模型,说明自适应选模态并不能完全替代针对性的视频训练。