商汤开源 SenseNova-Vision,一模型覆盖检测到 3D 重建
socialwithaayan · x · 2026-07-29
商汤开源了 SenseNova-Vision,主打把一长串视觉任务收敛到同一套权重里。
- 项目把自己定位为“Vision as Unified Multimodal Generation”。
- 覆盖的任务包括检测、分割、深度估计、表面法线、OCR、关键点和 3D 重建。
- 作者强调,不再是给每个任务拼一套专用模型,而是用同一个文本接口统一驱动。
- 帖子里也给了实测反馈:在客厅场景里,模型的 mask 大体干净、推理尚可,但仍会把沙发靠垫误认成书。
「多模态」频道最新
- Flux3 的风格保持更强,适合动画儿童书视觉 — arnicas · 2026-07-29
- 教授实测 Flux 3:复杂提示词还原度极高 — emollick · 2026-07-29
- Flux3 新测试能跟住 Gertrude Abercrombie 风格和猫头鹰提示 — arnicas · 2026-07-29
- Flux3 新测试显示能较好遵循马蒂斯画风 — arnicas · 2026-07-29
- LTX2.3 Cleanplate 可在音乐视频里大幅抹除人物 — i_sell_you_lies · 2026-07-29
- 阿语帖子分享 Nano Banana 2 人像生成提示词 — aziz4ai · 2026-07-29