SmartMage:动态编排多模态信息,提升 3D 场景理解能力

Yue Zhang · hf · 2026-08-07

理解 3D 场景需要综合处理来自视觉、几何等多种模态的异构信息。然而,现有的多模态大语言模型(MLLMs)通常采用固定的模态组合,忽略了不同查询对模态的实际需求差异,这不仅会引入语义噪声,还浪费了算力。

为了解决这一问题,本文提出了 SmartMage,一个能够针对 3D 场景理解动态编排异构模态的统一 MLLM。该模型主要包含两个核心模块:

实验表明,SmartMage 在五个 3D 场景理解基准测试中均达到了 SOTA(当前最优)表现,并且在仅基于 RGB 的视频理解基准上也取得了极具竞争力的结果。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →