PANORAMA 实现全景级图文对齐:每句话都带像素级分割掩码

Panorama-grounding · hf · 2026-09-17

现有 VLM 生成的图像描述虽然流畅,但难以可靠关联到像素。PANORAMA 研究全景接地描述(panoptic grounded captioning)任务:同时描述前景物体与背景区域,并为每个指称短语配上像素级掩码。

三大贡献:

代码、数据与模型已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →