商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集
机器之心 · wechat · 2026-07-21
这篇公众号文章把商汤在 WAIC 2026 的两项动作放在一起看:日日新 SenseNova U1 Pro 和 SenseNova-Vision。
U1 Pro
- 面向长程交付任务的原生多模态智能体基座模型。
- 号称把理解、生成、编辑统一到同一表征空间里。
- 技术上强调近乎无损的视觉接口、原生 MoT 架构,以及文本/像素的统一训练。
- 文章称它可围绕复杂目标跑多轮 Agentic Generation Loop,实现风格与局部文本同步修正。
SenseNova-Vision
- 把目标检测、分割、深度估计、三维重建等经典视觉任务,改写为原生多模态生成问题。
- 不再依赖 task-specific heads,而是在同一空间里统一建模文本、像素、语义和几何。
- 商汤还开源了 SN-VC-50M,一个包含 5000 万 视觉监督样本的数据集。
- 文中称它在结构化视觉理解上达到 SOTA,并在几何、分割等任务上接近顶尖专用模型。
文章的整体观点是:视觉 AI 正从“模块拼接”走向“统一基座”,未来大模型要同时吸收理解、生成、感知与行动能力。
所属事件:商汤发布多模态基座U1 Pro并开源视觉数据集(6 条相关)→
「多模态」频道最新
- LingBot-Video:30B参数仅激活3B,具身视频模型新架构 — alifcoder · 2026-07-21
- GlobalGPT 宣称已接入 GPT-5.6 和 Kimi K3,可按任务切换 — alifcoder · 2026-07-21
- AI 视频生成的死穴:角色一致性极难维持 — eyishazyer · 2026-07-21
- 开源图像库 PixlStash 新增智能标签审查队列,优化 LoRA 训练清洗流程 — Infamous_Campaign687 · 2026-07-21
- ElevenLabs 设五万美元奖金池,征集最热 AI 音乐 — charis_ai · 2026-07-21
- 作业拍照应用发现,难点不是 OCR 而是日期歧义和任务拆分 — Hayk_D · 2026-07-21