商汤开源视觉多模态模型

JaynitMakwana · x · 2026-07-13

SenseTime 发布/开源了 SenseNova-Vision-7B-MoT,主打“一个模型覆盖主要视觉任务”。

这条内容强调它把传统计算机视觉重新表述为可被语言或视觉提示词操控的多模态生成系统,并且不需要任务专用头。

同时它给出与 Google DeepMind Vision Banana 的对比成绩,声称在多个任务上更强,例如:

发布文案还提到,这是建立在 SenseTime 十年视觉 AI 经验之上的新一代视觉多模态模型。

所属事件:商汤开源 SenseNova-Vision-7B-MoT(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →