商汤多模态走向成品交付
新智元 · wechat · 2026-07-20
这篇文章把商汤的多模态系统描述为一次从“给答案”走向“交付成品”的升级。
文中重点介绍了 SenseNova U1 Pro:它被定义为面向长程任务的原生多模态智能体底座,核心是“理解、生成、行动”的统一。作者用世界杯战报图、原创电影海报、漫画、广告、杂志封面等例子说明,这套循环式能力可以直接产出可交付物,而不是只给局部修改建议。
文章还介绍了开源统一视觉大模型 SenseNova-Vision,把检测、分割、深度估计等经典视觉任务整合到同一模型里,强调它不仅能看图,还能从复杂图像中推断结构和物理空间信息,适合工业计数、仓储等场景。
最后,文章把这套能力包装成“超级个体”的生产力工具:非程序员也能把行业经验沉淀成可复用流程,商业计价单位也应从 token 转向 task。
所属事件:商汤发布多模态基座U1 Pro并开源视觉数据集(6 条相关)→
「多模态」频道最新
- Seedance 2.0 把罗马意面做成了 AI 反应梗图 — azed_ai · 2026-07-21
- 一套月食梦境图像提示词,附多张生成示例 — LudovicCreator · 2026-07-21
- Midjourney 8.2 预览版展示双重曝光与风格控制效果 — michaelrabone · 2026-07-21
- Travel MCP Server 为智能体补上旅行规划工具 — modelcontextprotocol · 2026-07-21
- Douyin 视频分析 MCP 可把分享链接转成结构化摘要 — modelcontextprotocol · 2026-07-21
- Synthesia 推出 Dubbing 2.0,支持 130 多种语言唇形翻译 — synthesiaIO · 2026-07-21