商汤开源统一视觉模型
智东西 · wechat · 2026-07-16
商汤发布并全面开源统一视觉大模型 **SenseNova-Vision**,主打把检测、分割、深度估计、3D 重建等经典视觉任务统一到同一个多模态生成框架里。文章称它在 Hugging Face 的 Any-to-Any Leaderboard 上综合得分登顶,并开放了模型、代码、训练配方和 5000 万条样本语料。 这套方案试图终结视觉 AI 里长期存在的“缝合怪”模式:过去不同任务往往各用一套专家模型,而 SenseNova-Vision 把任务本质统一为生成问题,让模型原生具备“看”和“理解空间”的能力。文中强调,这不仅让视觉任务之间形成能力共享,也让自然语言可以直接定义新的视觉任务。 文章还展示了几个泛化案例:零样本理解《我的世界》画面、处理超稠密物体分割、识破视觉错觉、看穿镜面反射。作者将其上升为视觉 AI 走向通用基础模型的一步,并认为它可能推动视觉 AI 从项目制走向平台化基础设施。
所属事件:商汤开源统一视觉大模型 SenseNova-Vision(2 条相关)→
「多模态」频道最新
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- 独立创作者用 Veo 3 和 Suno 做出《MALINI》,门口声音才是真实的 — prakm023 · 2026-07-21
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21