SenseNova-Vision Unifies Vision Tasks

liuziwei7 · x · 2026-07-09

SenseNova-Vision is introduced as a model that unifies computer vision into multimodal generation.

It can simultaneously handle detection, OCR, depth, segmentation, keypoints, normals, and camera pose using a single model without task-specific heads. It can also generate text, image, or mixed outputs based on natural language instructions.

Related event: SenseNova-Vision Unifies Vision Tasks With 7B-MoT(4 posts)→

Original post →

More from Multimodal

Multimodal channel →