SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo
cs.CV, cs.AI
2026-08-14
浙大与商汤把 3D 重建、稠密对应、空间推理统一成指令条件生成任务,塞进一个 Bagel-7B 原生多模态模型:空间推理四基准平均分全面领先,SPAR 上 66.60 对 Spatial-MLLM 的 33.74。
从图像恢复几何结构、建立帧间对应、理解空间关系,本是同一物理场景的三种互补表示,却被拆在三套系统里:几何重建用专门网络,光流用另一套,空间问答又是 VLM 加外挂几何模块。表示不共享,知识不迁移,每个任务各自为政。已有的统一尝试要么加任务专属回归头,要么外接几何预测模块,都没吃到原生多模态生成模型的红利。
SPARGen 的核心动作是把异构空间输出统一翻译成多模态生成模型的两种原生输出形态,建在 Bagel(7B,MoT 架构,理解与生成双专家共享注意力)之上:
指令是统一接口:同一模型,改一句指令就从重建切到光流或问答,不需要任务专属头或外挂模块。训练数据横跨空间问答(MindCube、OmniSpatial、OST-Bench、SPAR-7M 等)、视觉几何(ScanNet++、Hypersim、CO3D 等十五个源)与光流(FlyingThings3D、Spring 等),64 张 H100 微调 100K 步,VAE 编解码器冻结。
| 基准 | SPARGen-7B | 最强对照 |
| SPAR 平均 | 66.60 | Spatial-MLLM-7B 33.74;Qwen2.5-VL-72B 36.84 |
| MindCube 平均 | 76.04 | Spatial-MLLM-7B 66.19 |
| OST 平均 | 79.16 | Spatial-MLLM-7B 74.80 |
| KITTI 光流 EPE(零样本) | 4.09 | RAFT 5.03;FlowFormer 4.10 |
| Sintel 深度 AbsRel | 0.235 | VGGT 0.265 |
| CO3D 相机旋转 RRA@30 | 96.84 | VGGT 98.79 |
15 个非专有类目里拿了 13 项第一。几何侧与专门模型的差距大幅收窄但不全反超:VGGT 在相机位姿与 7Scenes 重建精度上仍占优。对照表里 GPT-4o 在 SPAR 平均只有 41.52,Claude Sonnet 4.6 是 44.19,都被这个 7B 模型压过。
消融证实三种监督互补:去掉几何监督,光流与空间推理同降;去掉光流监督,7Scenes 重建误差上升、SPAR 平均从 66.60 掉到 65.92;去掉推理监督,重建略降但光流略升,说明自回归 token 生成与稠密场预测之间存在轻微的容量竞争。
空间智能是具身智能与机器人技术的地基,而当前 VLM 在这上面恰好最弱。SPARGen 证明了一件事:不用外挂几何模块,原生多模态生成的两条通路(自回归序列与 rectified flow 图像生成)足以承载异构空间任务,而且多任务监督互相喂饭:几何帮推理,对应帮重建。对从业者的直接价值是一个模型顶三个:同一 checkpoint 做深度、光流、空间问答,部署与迭代成本都降。渐进改进的成分不小(几何指标未全面超越专门模型),但「统一不掉队」本身在此前无人做到。
作者只给了一条:冻结 VAE 的空间压缩对几何边缘与高精度物理量是瓶颈。深度要经 8 倍下采样的 latent 再重建回来,亚像素级的边缘注定糊。
读下来还要补几条。量化分辨率 10^-3 意味着相机位姿精度被锁死在毫米/千分之一弧度量级,对高精度重建场景可能不够;「15 项里 13 项第一」的对照集是论文自选的非专有模型,GPT-4o 与 Claude Sonnet 4.6 虽在表里但被排除在排名外,且它们本就不是空间任务的选手;消融只做了减法(去掉某类监督),没有对「统一表示 vs 简单多任务头」这一核心主张的直接对照,即便赢了,赢在原生生成通路还是赢在数据配比,论文分不开。空间问答基准(SPAR、MindCube 等)多数由 LLM 合成或含合成场景,与真实物理场景的差距未讨论。