QCell: Recombining and Aligning Cell Queries for Overlapping Instance Segmentation
Yaroslav Prytula, Anton Popov, Dmytro Fishman
cs.CV, cs.AI, cs.LG
2026-08-29
在MaskDINO上加查询级分解重组与对比对齐,QCell在ISBI2014上AP 65.9、AJI 78.6,相对基线分别高2.2和2.7,漏检降到8.7%,并放出密集类器官新基准。
显微镜图像里的细胞经常叠在一起。跟自然图像的遮挡不一样:被挡住的那一块往往还透出来,只是对比弱、边界糊,交叠区是两坨细胞的混合信号。下游要量形态、数密度、看空间组织,叠错一刀,统计全歪。
现有解法多半困在局部 RoI 里。DoNet 把细胞团拆成交集和补集再拼回去,BCNet 用双层图卷积,AISFormer 在 RoI 里塞几种 mask token。它们都缺全局视角:整张图里,每个实例跟邻居怎么分赃交叠区。细胞形态又极端多样,自然图像那套可学的形状先验基本用不上。
QCell 建在 MaskDINO 上。MaskDINO 是一套 query 式分割框架:一组可学习的 query 在全图特征上做注意力,每个 query 对应一个实例。细胞叠在一起时,相邻 query 会通过 self-attention 互相拉近,表征塌缩,两坨细胞被合成一张 mask。
第一招是 instance recombination,查询级的分解再重组。每个 content query 过三个轻量 MLP,拆成 amodal(完整轮廓)、visible(没被盖住的部分)、invisible(被盖住的部分)三个子查询,各自跟像素特征点积出 mask,用对应真值监督。三个子查询再融合成一个 refined query,去预测完整的 amodal mask。另外加一条 consistency regularization:refined mask 应该等于 visible 和 invisible 预测的 XOR,梯度只走 refined 这一路,逼三个子查询各管一块、拼起来还能对上。这是把 DoNet 的分解重组从区域提案搬到了 query 空间,不再依赖上游检测框。
第二招是 contrastive query learning。DN-DETR 那套 denoising query 本来给训练加速用,给真值框加噪声再让解码器还原。这里拿它们当锚点:同一细胞各 denoising group 的 DN query 当正样本,别的细胞的当负样本。InfoNCE 拉出可区分的实例特征,cosine alignment 再把不同细胞的 query 往正交推。论文用 DN oracle 验证过:测试时把匹配上的主 query 预测换成对应 DN query,ISBI 上 AP 从 63.7 跳到 68.6,AJI 从 75.9 到 80.0。DN query 确实更干净,当锚点说得通。
总损失是 MaskDINO 原损失加上重组、判别、对齐三项,每层 decoder 都算。骨干是 ImageNet 预训练的 ResNet-50,query 数在 ISBI 和 Revvity 上 100、Organoids 上 300,单卡 H200,三个随机种子取平均。
三个基准:ISBI2014 宫颈细胞质(半透明叠得最狠)、Revvity-25 亮场癌细胞、新放的 Organoids 类器官。Organoids 测试集平均 96 个实例、最多 223,密度比前两个高一个数量级。
| 方法 | ISBI AP | ISBI AJI | Revvity AP | Organoids AP |
| DoNet | 60.9 | 75.2 | 44.6 | 50.5 |
| MaskDINO | 63.7 | 75.9 | 52.3 | 49.7 |
| QCell | 65.9 | 78.6 | 52.9 | 51.0 |
相对 MaskDINO,ISBI 上 AP +2.2、F1 +2.3、AJI +2.7,对象级漏检 FNo 从 11.6% 降到 8.7%。Revvity 和 Organoids 上 AP 只高 0.6 和 1.3,AJI 几乎持平(73.6 vs 73.5,63.2 vs 63.1)。参数 45M、FLOPs 182G,相对 MaskDINO 的 44M/163G 略增。DICE 三个基准都几乎不动,增益主要来自分开实例,不是修边界。
消融更说明问题。只加对比两项,ISBI AP 到 67.0,比完整模型的 65.9 还高。论文自己的解释:重组把基线漏掉的重度遮挡细胞捞回来了,AP50 和 F1 更好,但推断出来的隐藏区域 IoU 一般,拉低了 AP75 和阈值平均的 AP。重度重叠子集(与另一实例 IoU ≥ 0.5)上,基线 11.67 AP,完整模型 13.68,绝对数字仍然很低。
对做显微图像分割的人,这是一次把 amodal 分解从 RoI 搬到 query 空间的干净实验。全局注意力确实比两阶段检测更适合半透明交叠。代码已开源。Organoids 这个密度基准值得跟,只是数据要申请。
对做 DETR/MaskDINO 的人,DN query 当对比锚点这一招可迁移:训练里本来就有、不额外标注,oracle 缺口还有 4.9 AP。完整模型 AP 低于只加对比的变体,两项模块不能无脑叠,要看更在乎召回还是精确 IoU。
论文没有单独的局限节。读下来有几处硬伤。
ISBI 训练集只有 45 张合成图,数字好看但外推要打折。Revvity、Organoids 相对 MaskDINO 的增益在 1 个 AP 上下,排行榜第一更多是靠 ISBI 拉开的。重度重叠子集 AP 仍只有 13.68,这个问题远没被打穿。
完整模型 AP 低于对比-only,如果排行榜只看 AP,重组模块是在拖后腿。骨干停在 ResNet-50,没测更大的 ViT。Organoids 数据「可应要求提供」,复现和跟进都多一层摩擦。PCTrans 被拿来比但不产 per-instance 置信度,AP 低得没有信息量。