SenseTime SenseNova-Vision: Unifies Visual Tasks via Multimodal Generation

rsasaki0109 · x · 2026-08-24

SenseTime's SenseNova-Vision formulates computer vision as a unified multimodal generation task, handling heterogeneous visual tasks through native text and image generation spaces. Natural language and visual prompts specify tasks, targets, and output schemas.

This shared formulation allows a single model to handle diverse visual tasks without task-specific architectures.

Original post →

More from Multimodal

Multimodal channel →