PANORAMA 实现全景级图文对齐:每句话都带像素级分割掩码
Panorama-grounding · hf · 2026-09-17
现有 VLM 生成的图像描述虽然流畅,但难以可靠关联到像素。PANORAMA 研究全景接地描述(panoptic grounded captioning)任务:同时描述前景物体与背景区域,并为每个指称短语配上像素级掩码。
三大贡献:
- PanoCaps 基准:基于全景分割数据集人工标注,提供近全覆盖的稠密描述与实体级图文对齐,并配套 phrase-mask 匹配协议与广义 Panoptic Quality (gPQ) 评测指标
- 方法:把短语接地建模为从「短语条件掩码提议池」中选择,用上下文化的短语表示条件化预训练分割器获得候选掩码,再学习选择;与描述生成联合训练
- 效果:在 PanoCaps 上取得最佳整体接地成绩,在多个像素级接地任务上持平或超过专门模型,支持一个短语对应单区域或多实例
代码、数据与模型已开源。
「多模态」频道最新
- 两张 5060 Ti 能不能训视频 LoRA?消费级多卡训练可行性讨论 — Inner_Employment_332 · 2026-09-17
- Geometric Essence 提示词模板:把主体简化为几何线条 — LudovicCreator · 2026-09-17
- 开源工作流实测:MiniMax H3 四段拼接 29 秒长视频无缝无痕 — ssx0731 · 2026-09-17
- Yue2 一把过:Crazy Train 翻出「Junction 乐团唱 Ozzy」味 — Kragrathea · 2026-09-17
- Midjourney 出图再用 Gemini「香蕉」加角色,直出 Grok 版曼达洛人 — michaelrabone · 2026-09-17
- Midjourney --sref 3530132817 一键生成 Q 版丑萌漫画风角色图 — michaelrabone · 2026-09-17