商汤开源视觉多模态模型
JaynitMakwana · x · 2026-07-13
SenseTime 发布/开源了 SenseNova-Vision-7B-MoT,主打“一个模型覆盖主要视觉任务”。
这条内容强调它把传统计算机视觉重新表述为可被语言或视觉提示词操控的多模态生成系统,并且不需要任务专用头。
同时它给出与 Google DeepMind Vision Banana 的对比成绩,声称在多个任务上更强,例如:
- RefCOCOg 指代表达分割:80.3 vs 73.8
- Cityscapes 语义分割:71.2 vs 69.9
- NYUv2 深度估计:98.1 vs 94.8
- NYUv2 法线估计:14.4 vs 17.8
发布文案还提到,这是建立在 SenseTime 十年视觉 AI 经验之上的新一代视觉多模态模型。
所属事件:商汤开源 SenseNova-Vision-7B-MoT(6 条相关)→
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11