让 7B 模型先在脑内重建 3D 场景再回答,空间基准超 72B 模型 29 分

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

Jaewoo Jung, Hyeonseo Yu, Honggyu An, Jisang Han, Mungyeom Kim, Minkyeong Jeon, Heeseong Shin, Wonjun Moon, Federico Tombari, Daniel Barath, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

NeurIPS 2026

cs.CV, cs.CL

2026-09-30

给 MLLM 插一组可学习 token,先把多视角图像重建成紧凑 3D 高斯再作答;7B 模型 SPAR-Bench 达 68.5,超 72B 模型 29 分。

这篇在解决什么

多模态大模型(MLLM)看单张图已经够强,把同一场景的 32 张多视角照片一起喂进去,问「床在你身后时,你面前是什么」,还是会翻车。此前的补救有两条路:一条往 patch 特征里缝点云 3D 坐标、加鸟瞰图标记、设计跨视角对齐的 pretext 任务;另一条把 VGGT、CUT3R 这类 3D 重建基础模型的特征拼进 MLLM。两条路都在给模型喂像素级几何,涨点却越来越边际,与人类的差距没有实质缩小。

KAIST AI 与 ETH Zürich 等机构的团队换了个问法:人并不是靠像素级对应理解 3D 的。认知科学的观察是,人看多视角图像做的是三件粗活:跨视角认出同一批物体,推断视角之间的相对几何,在脑内拼一个粗略布局。支撑推理的表征是物体级、近似的。与其把几何告诉模型,能不能让模型自己把场景想象出来?

方法

Imagine3D-LLM 建在 LLaVA-Video-7B 上,改动集中在输入序列:在图像 token 和文本 token 之间插入 2592 个可学习的 Gaussian summary token。32 张图共 6720 个图像 token,summary token 约每图 81 个。训练同时做三件事:

两个设计选择撑起全文。第一,高斯从专门的 summary token 预测,不从图像特征直接预测,堵死「把 2D 内容原样拷贝成图像对齐高斯」的捷径。第二,summary token 数量远小于图像 token(2592 对 6720),构成信息瓶颈:同一物体在多个视角反复出现,只能合并进共享 token,模型被迫分辨哪些物体在跨视角复现、它们在 3D 里如何拼合。训练完对 summary token 做 K-means,簇天然按物体分,全程没有聚类监督。

消融把「想象」的因果钉得比较死:把教师的 query token 直接喂给 LLM,SQA3D EM 56.4;只用蒸馏不用重建,56.6;两者都停在 baseline 的 56.5 附近。只有重建损失在场,才涨到 63.8。

结果

基准指标Imagine3D-LLM-7B最强对照
SQA3DEM63.8Ross3D 63.0
ScanQACIDEr109.3Ross3D 107.0
Scan2Cap[email protected]99.23DRS 86.1
ScanRefer[email protected]62.8同配方 baseline 58.3
SPAR-Bench平均分68.53DThinker-7B 63.3

SPAR-Bench 按认知层级拆成 low/medium/high,涨幅集中在 medium(视角变化推断)和 high(空间想象)。同骨干、同数据、同训练量的受控 baseline 在 medium 层从 51.5 涨到 67.0(+15.5),涨点归因于目标函数而非数据。平均分上,7B 模型比 Qwen2.5-VL-72B 高 29.1 分。

ScanQA 的 EM 是少数没赢的指标(29.9,Ross3D 30.8)。去掉蒸馏只留重建损失,训 4 个 epoch 到 63.7/67.9,接近完整模型 1 epoch 的 63.8/68.5,蒸馏主要在省训练时间。token 数量有甜点:1296 容量不足,5184 瓶颈太松,都不如 2592。

为什么重要

表 7 对做 3D MLLM 的人是条可执行的结论:把 3D 基础模型的表征「喂」进 LLM 几乎无效,让 LLM 自己算出 3D 结构才有效。这与位置编码、视觉标记、特征融合整条「被动接收几何」的路线形成对照。重建监督只落在 summary token 上,LLM 自己的图像特征却变得更跨视角一致:注意力更锐利,PCA 可视化里同一物体跨视角同色。结构化监督重塑了整个模型的内部表征,推理期代价只是多 2592 个 token,不需要教师,也不需要点云输入。对通用 MLLM 团队,这是一个可嫁接的训练目标,不是一套定制架构。

局限与存疑

术语

原文与代码

相关论文

全部论文解读