商汤开源 SenseNova-Vision-7B-MoT
商汤旗下 SenseNova 发布并完全开源了视觉模型 SenseNova-Vision-7B-MoT,并在 Hugging Face 上线后迅速走热。围绕这次发布的帖子普遍把它概括为“一个模型覆盖主要视觉任务”的统一视觉多模态方案:不再把检测、分割、深度等任务拆成独立模型或专用 head,而是把传统计算机视觉重新表述为可被语言或视觉提示操控的多模态生成过程。这也是它受到关注的核心原因——商汤试图用单一模型打通视觉理解与视觉生成的多种能力。
关键能力
官方账号 @sensenova 将其描述为一套 any-to-any 的统一多模态管线。多条帖子转述的覆盖范围包括图像生成、图像编辑、检测、OCR、GUI 理解、分割、深度估计、法线估计,以及稠密相关任务。
官方口径与基准对比
多条转发帖援引官方材料称,模型可被语言或视觉提示驱动,不依赖任务专用 head。@HeyNayeem 转述官方说法称,模型在多项视觉基准上优于 Google DeepMind 的对应视觉模型;@liuziwei7 也转述官方口径称其在多项视觉基准上保持竞争力,并能处理未见过的任务。不过现有帖子材料并未给出具体的基准名称、分数或完整对手清单。
2026-07-13 ~ 2026-07-15 · 6 条相关
一手来源
- SenseNova-Vision-7B-MoT 上线 — sensenova ·
- 商汤开源视觉多模态模型 — JaynitMakwana ·
- 【源头】商汤开源视觉多模态模型 — JaynitMakwana · 2026-07-13
- 商汤开源统一视觉多模态模型 — nikola_mr64990 · 2026-07-14
- 【源头】SenseNova-Vision-7B-MoT 上线 — sensenova · 2026-07-14
- SenseNova-Vision-7B-MoT开源 — joemeno · 2026-07-15