7B 开源视觉模型 SenseNova-Vision:单架构搞定分割、深度与 3D 重建
SandyL925 · reddit · 2026-08-13
商汤开源了 7B 参数的视觉模型 SenseNova-Vision(Apache 2.0)。该模型采用混合专家(MoT)架构,将几乎所有计算机视觉任务统一转化为单一的生成问题。
- 核心能力:无需特定任务预测头,仅用一套权重即可处理目标检测、关键点检测、OCR、各类分割(二值、实例、语义)、深度与表面法线估计。
- 突出亮点:支持多视图 3D 重建和相机位姿估计。通常这类任务需要依赖 COLMAP 等专业工具,但该模型仅需单次提示即可完成。
- 训练与部署:基于 5000 万条指令-响应对训练。提供在线 Demo 和 Hugging Face 权重下载。但部署门槛较高,运行完整 Web Demo 至少需要 1 张 80GB 显存的 GPU,基准测试则需 8 张 80GB GPU。
「模型」频道最新
- 大模型为何空有高智商却写不好文章?后训练方向遭质疑 — matt_slotnick · 2026-08-13
- DeepSeek-V4-Pro-0813 模型权重重新开放下载 — panchovix · 2026-08-13
- Unsloth 支持免费微调 Muse Glimmer 30B,24GB 显存即可跑 — danielhanchen · 2026-08-13
- 开源模型真能替代闭源?用户因额度受限考虑切换 — SensitiveReading5297 · 2026-08-13
- 研究者驳斥 ARC-AGI 独家论:多数基准测试均能体现思维模型能力跃升 — scaling01 · 2026-08-13
- 正常修改税务数据被当欺诈?AI 助手金融场景闹乌龙 — daniel-editide · 2026-08-13