Imagine3D-LLM 让多模态模型先「脑补」3D 场景再答题
kaist-ai · hf · 2026-10-01
现代 MLLM 处理单图尚可,但难以跨视角整合证据形成 3D 理解。受人类空间推理启发——人先跨视角识别常见物体、推断视角相对几何、再拼出粗略 3D 布局——KAIST 提出 Imagine3D-LLM:在图像 token 后追加少量可学习摘要 token,解码为紧凑的 3D Gaussian Splatting 场景表示,用光度重建损失监督,并与标准下一 token 预测联合训练。
值得注意的是,尽管只有摘要 token 直接接受重建监督,该目标也强化了 LLM 底层图像特征的跨帧对应,说明学会重建会向全模型传播 3D 感知信号。模型在多个空间推理与 3D 理解基准上稳定超越此前方法,表明「想象场景」比被告知逐像素几何更有效。
「多模态」频道最新
- Seedance 2.5 实测:动漫级双刀打斗搬进写实电影感 — SimplyAnnisa · 2026-10-01
- Midjourney --sref 3896456162 复刻 70 年代柯达胶片迪斯科质感 — michaelrabone · 2026-10-01
- LoRA 训练完成≠学到了风格:一套可复现的 SDXL 验证流程 — no3us · 2026-10-01
- 剪辑师开源 open-fusion-mcp:Claude 直接在达芬奇里做可编辑动效 — JohnnyLegion · 2026-10-01
- Raven Noire 边听哥特音乐边写日记的 AI 视频片段 — Street-Pound5762 · 2026-10-01
- 破解 MiniMax H3 VAE 细节上限失败,却意外产出 2X 细节增强方案 — NoMouse9610 · 2026-10-01