SenseNova-Vision:将视觉任务重构为统一多模态生成
rsasaki0109 · x · 2026-08-31
SenseNova-Vision 提出将计算机视觉表述为统一的多模态生成任务。通过统一多模态模型(UMM)的原生文本和图像生成空间来表达异构视觉任务。
核心机制:
- 指令与提示: 使用自然语言指令和可选视觉提示来指定任务、目标区域、输出模式和解码约定。
- 文本生成: 处理分类、边界框、关键点、OCR 字符串、相机参数等符号化视觉记录。
- 图像生成: 处理分割掩码、深度图、表面法线、多视图点图等密集空间目标。
- 混合响应: 支持结合符号和密集输出的组合任务。
「多模态」频道最新
- 实测 MiniMax+Flux 组合生成长视频循环 — LanceCampeau · 2026-08-31
- GPT IMAGE 2 实测:真实摄影与手绘插画的拼贴效果惊艳 — GCWebDesigner · 2026-08-31
- 法国导演用 AI 视频生成短片《La Nona Gigante》 — venturetwins · 2026-08-31
- MiniMax H3 Max 视频生成速度超越播放速度 — isidentical · 2026-08-31
- 探索思维转视频:生成式实验与视觉语法探索 — Kyrannio · 2026-08-31
- Grok 与 GPT 同指令生图,结果惊人相似 — teortaxesTex · 2026-08-31