商汤多模态走向成品交付

新智元 · wechat · 2026-07-20

这篇文章把商汤的多模态系统描述为一次从“给答案”走向“交付成品”的升级。

文中重点介绍了 SenseNova U1 Pro:它被定义为面向长程任务的原生多模态智能体底座,核心是“理解、生成、行动”的统一。作者用世界杯战报图、原创电影海报、漫画、广告、杂志封面等例子说明,这套循环式能力可以直接产出可交付物,而不是只给局部修改建议。

文章还介绍了开源统一视觉大模型 SenseNova-Vision,把检测、分割、深度估计等经典视觉任务整合到同一模型里,强调它不仅能看图,还能从复杂图像中推断结构和物理空间信息,适合工业计数、仓储等场景。

最后,文章把这套能力包装成“超级个体”的生产力工具:非程序员也能把行业经验沉淀成可复用流程,商业计价单位也应从 token 转向 task。

所属事件:商汤发布多模态基座U1 Pro并开源视觉数据集(6 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →