Google 发布 TIPS:具备空间感知的视觉语言模型,主打分割与深度估计
_akhaliq · x · 2026-08-21
Google 在 Hugging Face 上发布了 TIPS,一个具备空间感知能力的视觉语言模型,专为分割(segmentation)和深度估计(depth estimation)等密集理解任务设计。
「多模态」频道最新
- Opus 5 生成 8 种独立风格的 Three.js 场景 — nptacek · 2026-08-21
- ComfyUI 推出 MiniMax H3 主体管理器节点 — 3deal · 2026-08-21
- 商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite — mhdfaran · 2026-08-21
- Meta发布Muse Spark 1.2:视觉转代码、机器人导航与视听理解 — AIatMeta · 2026-08-21
- Gemini 视频电影感升级与换脸保护提示词模板 — ifioknkem · 2026-08-21
- MiniMax H3 生成短片《Boom in City》引热议 — VasaFromParadise · 2026-08-21