商汤开源统一视觉模型

liuziwei7 · x · 2026-07-14

SenseTime 开源了 SenseNova-Vision-7B-MoT,主打把多种视觉任务统一到一个生成式模型里,不再依赖任务专用 head。

官方宣称它可被语言或视觉提示词驱动,在多项视觉基准上保持有竞争力,并能处理未见过的复杂视觉任务。引用中还给出了与 Google DeepMind Vision Banana 的对比:在指代分割、语义分割、深度估计和表面法线等任务上指标更高。

所属事件:商汤开源 SenseNova-Vision-7B-MoT(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →