商汤开源统一视觉模型
智东西 · wechat · 2026-07-16
商汤发布并全面开源统一视觉大模型 SenseNova-Vision,主打把检测、分割、深度估计、3D 重建等经典视觉任务统一到同一个多模态生成框架里。文章称它在 Hugging Face 的 Any-to-Any Leaderboard 上综合得分登顶,并开放了模型、代码、训练配方和 5000 万条样本语料。
这套方案试图终结视觉 AI 里长期存在的“缝合怪”模式:过去不同任务往往各用一套专家模型,而 SenseNova-Vision 把任务本质统一为生成问题,让模型原生具备“看”和“理解空间”的能力。文中强调,这不仅让视觉任务之间形成能力共享,也让自然语言可以直接定义新的视觉任务。
文章还展示了几个泛化案例:零样本理解《我的世界》画面、处理超稠密物体分割、识破视觉错觉、看穿镜面反射。作者将其上升为视觉 AI 走向通用基础模型的一步,并认为它可能推动视觉 AI 从项目制走向平台化基础设施。
所属事件:商汤开源统一视觉大模型 SenseNova-Vision(2 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11