让注意力直接在三维世界坐标里算,Qwen-3D 把通用 3D 视觉语言模型追平专家

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

cs.CV

2026-08-04

CMU 的 Qwen-3D 让视觉语言模型直接在三维世界坐标里做注意力,ScanRefer 三维定位只差专家模型 0.7 分,3D 实例分割 mAP 较前代通用模型翻倍,2D 能力基本不掉。

这篇在解决什么

视觉语言模型(VLM)处理单张图片没问题,但遇到一个房间、一段连续拍摄的多视角视频就力不从心。原因很直接:注意力随序列长度平方增长,上下文窗口又有限,逐帧堆 token 很快撑爆。

3D 几何给了一个天然的压缩办法。把每帧的深度和相机位姿拿来,所有视角的观测都能投进同一个世界坐标系,合并成一份持久的、对齐到真实场景的表示。时间上隔得很远的两帧,如果拍的是同一块地方,在 3D 里就成了相邻的。

已经有一批 3D LMM 沿这条路走,但它们在定位(grounding)和分割这类需要密集几何预测的任务上,明显打不过专门训练的 3D 感知模型。Qwen-3D 的作者认为瓶颈在解码环节:现有方法要把 3D 预测通过语言 token、候选框挑选、或一个轻量的 <REF> 查询 token 往外吐,语言推理和密集几何预测之间隔了一层。

方法

Qwen-3D 在 Qwen2.5-VL 之上加了三件事,核心是让几何贯穿表示、注意力和解码三个环节。

第一件,几何感知的场景表示。RGB-D 帧连同深度和相机位姿被投进统一的 3D 坐标系,再用 5cm 体素做 token 合并,同一个体素里的特征和坐标取平均池化。几百帧的多视角流被聚成一批无序的 3D token。这一步不能省,作者说没有体素池化,即使帧数少很多也会显存溢出。

第二件,几何感知的注意力。Qwen2.5-VL 原本用 2D 多模态旋转位置编码(mRoPE),把位置拆成时间、高、宽三个维度。Qwen-3D 换成 3D 旋转位置编码,PE3D 拆成时间、x、y、z 四路,让注意力直接在世界坐标里算,而不是在各自独立的图像帧里。同时把视觉 token 上的因果掩码换成全注意力,定位这类非自回归任务本不该一个 token 只能看前面的。

第三件也是最关键的一件,几何感知的解码。一个 Mask2Former 风格的查询解码器,让若干可学习的 object query 交替地对视觉 token 和语言 token 做交叉注意力,每个 query 同时预测分割掩码和文本片段。语言由此直接落在 3D 场景表示上,而不是挤过一个个 <REF> token。这一步把指代定位、实例分割、问答统一进一个架构,图片和视频都能处理。

训练上是 2D 和 3D 联合:3D 侧约 25.5 万样本(ScanQA、SQA3D、ScanRefer、ScanNet 等),2D 侧是 RefCOCO 家族和 LLaVA-Instruct。2D 数据还按一定概率用重建模型(如 MoGE)提升成 3D 来喂。全程只新增约 5000 万可训练参数,骨干网一并微调。

结果

Table 1,3D 定位与问答(ScanRefer 用 [email protected],两个问答用 EM@1):

方法[email protected]ScanQA EM@1SQA3D EM@1
UniVLG(专家,SOTA)63.525.750.2
LLaVA-3D-7B(前通用 SOTA)50.127.055.6
GPT-4o(2D VLM)48.218.0
Qwen-3D-7B62.831.559.6
Qwen-3D-3B62.228.055.4

ScanRefer 上 Qwen-3D-7B 的 62.8 只比专家 UniVLG 的 63.5 低 0.7 分,而两个问答指标(ScanQA EM@1 31.5、SQA3D 59.6)直接超过所有对手。它把前通用 SOTA LLaVA-3D 拉开 12.7 分,把 GPT-4o 拉开 14.6 分。而且这大多是用 3B 骨干做到的,在多项指标上追平甚至超过那些 7B 及以上的方法。

域外泛化更夸张。在用 iPhone 激光雷达采集、与训练域明显不同的 ScanNet++/Locate3D 上,Qwen-3D-3B 拿到 [email protected] 55.7,UniVLG 只有 32.3、Video-3D-LLM 33.2,差距超过 22 分。

实例分割(Table 3,ScanNet200):Qwen-3D-3B 的 mAP 25.3,把之前唯一能做全场景检测的通用模型 Grounded-3D-LLM(12.1)甩开一倍多,逼近语言提示类的专家 UniVLG(27.9),离最强的闭词表专家 ODIN(31.5)还有约 6 分。

2D 能力基本没掉。RefCOCO 上 Qwen-3D-3B 是 88.1,基座 Qwen2.5-VL-3B 是 89.1,只退 1 分。

为什么重要

3D 通用模型长期被专家模型压着打,原因多被归结为数据少、骨干弱。这篇给出的答案是瓶颈在解码那道语言转译。换成查询式掩码解码器、让注意力进 3D 空间之后,通用模型在定位上追平专家、在问答上反超,还能当一个全场景分割器用,这是大多数只预测几个框的 3D 定位模型做不到的。

实际可用性也不差。它能把最多 400 帧的多视角流压成一批 3D token,把输入帧从 400 砍到 15,定位精度还能维持在 56%,没有断崖式下跌。单次前向约 2 秒(反投影 20 毫秒、体素化 1 毫秒),加上一次性的 SLAM 重建 3 到 7 秒;同一个场景重建一次,后续查询只花那 2 秒。代码和权重已发布在 qwen-3d.github.io。

适合的场景:室内外机器人、具身智能、AR/VR 里需要对真实空间做指代、分割和问答。够不到静态场景之外的需求。

局限与存疑

作者自己列了三条:只处理静态场景,动态环境需要 4D 表示;一次只做一步定位,难以对多个物体做组合式推理;依赖外部估计的深度和位姿,重建误差会反过来限制性能。

读下来还有两点存疑。其一,深度和位姿都是外部模型(MoGE 等)给的。论文虽然在 ScanRefer 上做了位姿、深度加噪实验,显示即使较重噪声也不崩、极端位姿错位下还能超过 UniVLG,但这是合成高斯噪声,真实 SLAM 漂移和动态物体伪影有没有这么友好没有验证。其二,3D 实例分割离闭词表专家 ODIN 还差约 6 个 mAP,「逼近专家」主要体现在定位和问答,分割上还差一截。

术语

原文与代码

社区讨论

相关论文

全部论文解读