Imagine3D-LLM 让多模态模型先「脑补」3D 场景再答题

kaist-ai · hf · 2026-10-01

现代 MLLM 处理单图尚可,但难以跨视角整合证据形成 3D 理解。受人类空间推理启发——人先跨视角识别常见物体、推断视角相对几何、再拼出粗略 3D 布局——KAIST 提出 Imagine3D-LLM:在图像 token 后追加少量可学习摘要 token,解码为紧凑的 3D Gaussian Splatting 场景表示,用光度重建损失监督,并与标准下一 token 预测联合训练。

值得注意的是,尽管只有摘要 token 直接接受重建监督,该目标也强化了 LLM 底层图像特征的跨帧对应,说明学会重建会向全模型传播 3D 感知信号。模型在多个空间推理与 3D 理解基准上稳定超越此前方法,表明「想象场景」比被告知逐像素几何更有效。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →