商汤 SenseNova-Vision:将视觉任务统一为多模态生成
rsasaki0109 · x · 2026-08-24
商汤发布的 SenseNova-Vision 将计算机视觉表述为统一的多模态生成任务。该模型通过统一的文本和图像生成空间处理异构视觉任务。自然语言指令和视觉提示用于指定任务、区域、输出模式等。
- 文本生成:输出类别、边界框、关键点、OCR 字符串、相机参数等符号化视觉记录。
- 图像生成:处理分割掩码、深度图、表面法线、多视图点图等密集空间目标。
- 混合响应:支持结合符号和密集输出的组合任务。
这种统一公式允许单一模型处理多种视觉任务,无需针对特定任务设计独立架构。
「多模态」频道最新
- 技术实战:将 Krea2 移植进 MiniMax H3 改善画质 — Key-Philosopher-9327 · 2026-08-24
- 分享 FLUX 3 电影感 Prompt:沙漠摩托车手实录 — LudovicCreator · 2026-08-24
- Minimax H3 生成手指依然困难?求助技巧 — Glittering-Cold-2981 · 2026-08-24
- Minimax H3 模型:运动上下文与潜空间放大的冲突 — Drock_belg · 2026-08-24
- ComfyUI 视频编辑:如何精准添加面部小丑妆 — degel1234567 · 2026-08-24
- 使用 Minimax H3 保持角色一致性的视频生成 — Oni8932 · 2026-08-24