商汤开源统一视觉模型

智东西 · wechat · 2026-07-16

商汤发布并全面开源统一视觉大模型 **SenseNova-Vision**,主打把检测、分割、深度估计、3D 重建等经典视觉任务统一到同一个多模态生成框架里。文章称它在 Hugging Face 的 Any-to-Any Leaderboard 上综合得分登顶,并开放了模型、代码、训练配方和 5000 万条样本语料。 这套方案试图终结视觉 AI 里长期存在的“缝合怪”模式:过去不同任务往往各用一套专家模型,而 SenseNova-Vision 把任务本质统一为生成问题,让模型原生具备“看”和“理解空间”的能力。文中强调,这不仅让视觉任务之间形成能力共享,也让自然语言可以直接定义新的视觉任务。 文章还展示了几个泛化案例:零样本理解《我的世界》画面、处理超稠密物体分割、识破视觉错觉、看穿镜面反射。作者将其上升为视觉 AI 走向通用基础模型的一步,并认为它可能推动视觉 AI 从项目制走向平台化基础设施。

所属事件:商汤开源统一视觉大模型 SenseNova-Vision(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →