SmartMage:动态编排多模态信息,提升 3D 场景理解能力
Yue Zhang · hf · 2026-08-07
理解 3D 场景需要综合处理来自视觉、几何等多种模态的异构信息。然而,现有的多模态大语言模型(MLLMs)通常采用固定的模态组合,忽略了不同查询对模态的实际需求差异,这不仅会引入语义噪声,还浪费了算力。
为了解决这一问题,本文提出了 SmartMage,一个能够针对 3D 场景理解动态编排异构模态的统一 MLLM。该模型主要包含两个核心模块:
- SMART 模块(语义引导模态自适应路由):利用语义先验、文本对齐和模态质量来选择与当前任务相关的模态。
- MAGE 模块(模态感知门控专家):利用模态先验指导专家激活,促进多模态推理的自适应专业化。
实验表明,SmartMage 在五个 3D 场景理解基准测试中均达到了 SOTA(当前最优)表现,并且在仅基于 RGB 的视频理解基准上也取得了极具竞争力的结果。
「多模态」频道最新
- AI 音乐视频生成案例:用 Grok 制作完整 MV — bennash · 2026-08-07
- 字节 Seedream 推出 Layerize API:一键将图片拆分为透明图层 — OdinLovis · 2026-08-07
- MiniMax H3 预览:支持 2K 分辨率与 5 倍加速 — RobbaW · 2026-08-07
- MiniMax H3 视频生成实测:细节还原优于 Seedance 2.5 — ZabihullahAtal · 2026-08-07
- MiniMax H3 视频无缝拼接技术:动作与音频跨片段连续 — Sad_Berry_4621 · 2026-08-07
- 开源 AI 视频广告工作流:一张图直接生成带货成片 — Fresh-Resolution182 · 2026-08-07