商汤 SenseNova-Vision:将视觉任务统一为多模态生成

rsasaki0109 · x · 2026-08-24

商汤发布的 SenseNova-Vision 将计算机视觉表述为统一的多模态生成任务。该模型通过统一的文本和图像生成空间处理异构视觉任务。自然语言指令和视觉提示用于指定任务、区域、输出模式等。

这种统一公式允许单一模型处理多种视觉任务,无需针对特定任务设计独立架构。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →