Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
Jiazhen Liu, Mingkuan Feng, Long Chen
cs.CV
2026-08-04
STAMPlus 把 MLLM 分割拆成对话(自回归)+ 掩码(一次性)两阶段,用带 ID 的目标清单驱动多类头;一个检查点通吃指代/推理/语义/实例/遥感分割,12 类延迟砍到 5.16 秒。
多模态大模型(MLLM)想把视觉任务都收进一个指令驱动的框架里。在识别和检测上这事基本成了,分割却卡在一个三难困境:要分割准、要不破坏模型原本的对话能力、要推理快。
根源是 MLLM 的自回归文本生成天生不适合吐密集的像素掩码。现有两条路各有妥协。一条是嵌入预测(LISA、GSVA、PixelLM、READ):让 MLLM 输出一个特殊 token 的嵌入,再去驱动一个外接的 SAM 式解码器。它对单个目标高效,但像素级监督会干扰语言建模,对话能力跟着掉,比如 LISA 有时会把「图里有几个物体?」也当成要分割。另一条是逐 token 预测(VisionLLM 的坐标、Seg-Zero 的思维链坐标、Text4Seg 的逐 patch 分类):保住了 token 接口、不用外接解码器,但要为每个目标自回归生成一长串掩码 token,高质量密集掩码慢得没法用。而且这两条都只能一次出一个二值目标掩码,多目标(语义、实例)场景要么重复跑、要么掩码含糊。STAMPlus 就是来解这个的,是同一团队 STAMP(CVPR 2026)的扩展。
核心是把对话和掩码生成拆开,作者叫 All-Mask Prediction。
阶段一,MLLM 照常自回归生成回复,末尾吐一个词表内的 <SEG> token 触发分割。这个 token 是普通词表项,不像 LISA 那样把嵌入绑到外接解码器,所以不引入像素级监督,对话能力得以保留。中间的 KV 状态被缓存下来。
阶段二,把与图像 patch 一一对应的 [MASK] 占位符直接预填进模型,每个占位符的初始嵌入和它对应 patch 的视觉特征、位置编码融合,得到「视觉增强的掩码嵌入」。然后用一次非自回归前向传播,靠一个混合注意力(对话历史走因果注意力、掩码 token 之间走双向注意力)把所有 patch 同时分成前景或背景。整个过程一次出齐,不像逐 token 法那样一个一个生成。可选地再用一个冻结的 SAM 把 patch 级结果细化成高分辨率掩码。
STAMP 就是这个范式的二值版,只能吐一张前景或背景掩码。STAMPlus 把它推到多目标,关键在两处结构扩展:
因为每个 patch 配一个掩码 token,空间粒度可以随输入分辨率走。普通自然图像用 1024 至 1280 个掩码 token;遥感小目标场景把输入分辨率和 token 预算一起加到 2560 至 3200,保住小目标的细节证据,结构化机制本身不变。
训练只有一个统一目标:文本生成损失加掩码预测损失。STAMPlus 在一份混合数据(RefCOCO 家族、gRefCOCO、ReasonSeg、遥感 RRSIS-D 与 EarthReason、COCO-Stuff、COCO Panoptic 与 MUSE、LLaVA-665k)上训练,全任务共用一个检查点,不做任务专属微调。基于 Qwen2-VL 的 2B 和 7B 版本。
单目标指代与推理分割上,STAMPlus 守住了 STAMP 的地盘还略涨。RefCOCO 家族均值 cIoU,STAMPlus-7B 81.0、STAMP-7B 80.7,都高过此前最强的 Text4Seg++(78.9)。ReasonSeg 均值 STAMPlus-7B 64.0 最佳,超 READ 的 61.1。遥感小目标:RRSIS-D 均值 76.2(强专门基线 74.4、Text4Seg++ 70.8),EarthReason 74.0(Text4Seg++ 70.1)。高分辨率缩放在受控对比里给 RRSIS-D 的 gIoU 涨 5.5、EarthReason 涨 4.9。
新增的多目标能力上:
| 任务 | 指标 | STAMPlus-7B | 对照 |
| 开放词表语义分割(ADE20K/PC/PAS 均值) | mIoU | 63.7 | 最佳 |
| 实例级多目标(MUSE,test) | gIoU/cIoU | 65.8/66.9 | Text4Seg++ 63.2/63.8 |
这是 STAMP 做不到的:STAMP 想分多个实例只能一遍遍重复二值预测,还要为每个实例准备无歧义的指代表达;STAMPlus 一条指令就能发现并区分多个实例,一次结构化预测返回。
效率是这篇的主打。单目标下 STAMP 的延迟跟嵌入预测法相当,远低于逐 token 法。多目标下,STAMP、LISA 这类方法每多一个类别就要重跑一次,延迟随类别数陡升;STAMPlus 多出来的开销几乎全在阶段一生成目标清单,所有类别共用一次阶段二,斜率平得多。12 个类别的延迟从重复跑 STAMP 的 13.50 秒降到 5.16 秒。
两段诊断也值得说。给阶段一补上人工标注的目标框,STAMPlus-2B 在指代分割的均值 cIoU 从 77.4 跳到 89.1,说明阶段一描述质量直接决定阶段二分割,也指明了改进路径(强化学习或外挂定位工具增强阶段一)。反向地,分割训练学到的空间接地还能反哺理解:用「看两眼」协议,STAMPlus-2B 在 TextVQA、InfoVQA、POPE、DocVQA 上均值 71.1,比同初始化的 Qwen2-VL-2B 高 2.6,每个基准都更好。
对做 MLLM 密集预测的人,这套「对话自回归、掩码一次性非自回归出齐」的接口是可迁移的范式:它绕开了像素级监督伤对话和逐 token 生成太慢这两个老问题,结构化目标清单又让同一个模型自然支持多类别、多实例分割。一个检查点通吃五类分割、延迟还能压下来,工程上很实在。
消融也把关键部件钉死了:去掉混合注意力或视觉增强的掩码嵌入,精度明显掉;分辨率可调,能在精度和延迟间换。LLaVA(Vicuna-7B)骨干的变体均值 cIoU 也有 77.0,说明这套范式不绑死 Qwen2-VL。
这篇是期刊扩展,作者自述的局限不多,另有几条要拎出来。多类头容量硬上限 200,虽然评测里没样本触顶,但面对城市场景几百个实例的全景分割会是个天花板。遥感那套高分辨率缩放(2560 至 3200 token)换精度是靠加算力换的,文中没给延迟代价的完整对照。
效率优势的对比对象要打折扣:STAMP 和 LISA 本来就不是为多目标设计的,把它们逐个重跑当地基线,等于挑了对自己有利的参照。分割反哺视觉理解那条结果只是初步证据,作者也明说用的是注意力代理而不是把离散掩码回灌进 VQA(STAMPlus 没训这个),所以只能说是分割训练改善了内部空间注意力的旁证,不是闭环。另外整篇是同一团队对自家 STAMP 的扩展,「解了三难」的提法较强,基准仍是标准那一套,跨场景的稳健性还需要社区验证。