Qwen-3D 模型发布:融合多视角几何 cues 提升空间推理
udmrzn · x · 2026-08-07
Qwen-3D 是一款具备空间理解能力的通用 3D 视觉-语言模型。该模型利用深度和相机位姿,将多视角输入融合在共享的 3D 空间中,从而实现视觉信息的自然压缩。
- 核心架构:引入 3D 旋转位置编码 (3D RoPE) 和密集掩码解码器,使注意力机制能直接在 3D 场景空间中运行,突破了传统基于独立图像帧的推理限制。
- 支持任务:涵盖空间推理、3D 定位、分割和视觉问答 (VQA)。
- 性能表现:在多项 3D 任务上超越了此前的 3D 大模型,同时保留了原有的 2D 视觉处理能力。
「多模态」频道最新
- 探讨 WAN 2.2 动作 LoRA 训练的最佳实践 — fluvialcrunchy · 2026-08-07
- Midjourney 结合 GPT-2 创意拼贴工作流与提示词 — Ror_Fly · 2026-08-07
- AI 视频实操:复古 DV 感旅行 Vlog 提示词拆解 — minchoi · 2026-08-07
- AI 视频实操:科幻机甲变身长镜头提示词拆解 — minchoi · 2026-08-07
- AI 视频实操:30 秒一镜到底长镜头提示词拆解 — minchoi · 2026-08-07
- 剪映集成 Seedance 2.5:单次生成 30 秒多参考视频 — minchoi · 2026-08-07