Are the Latent Representations of Foundation Models for Pathology Invariant to Rotation?
Matouš Elphick, Samra Turajlic, Guang Yang
eess.IV, cs.CV
2024-12-17
在 TCGA-KIRC 363 张肾癌切片上,12 个病理基础模型被逐度旋转后比对表征。做过旋转增强的一组更稳,PathDino 的 m-kNN 达 0.85,Virchow 仅 0.53,t 检验 p < 0.0001。
病理切片没有「正着放」这一说。取材、扫描、阅片时,整张 H&E 片子可以转到任意角度,同一腺腔转 90° 仍是那块组织。数字病理的基础模型却把全切片切成 256×256 的小块,压成一段向量,再交给 MIL 或线性头去做检出、分级。块一转、向量就指向别处,后面所有任务看到的都是「另一块组织」。
现有病理基础模型论文几乎都在报跨中心准确率,几乎没人测过几何变换。ViT 没有旋转归纳偏置:位置编码钉在网格上,注意力也不知道像素转过。CNN 至少还带一点平移等变性,ViT 连这点都没有。要稳住朝向,只能在训练时用旋转增强把不变性学出来。这篇把这句话量化了。
探针数据是 TCGA-KIRC,363 张肾透明细胞癌 H&E 全切片,20× 读图。先在 HSV 空间抠前景,保留最大的 5 个轮廓,从包围盒里抽 256×256 的块,前景像素至少 75%。一共抽了多少块,论文没写。
12 个模型都是自监督训出来的病理编码器,推理时冻结:Conch、Hibou-B/L、Kaiko-B/L、PathDino、Phikon、Phikon 2、Prov-GigaPath、UNI、Virchow、Virchow 2。每块从 0° 转到 360°,步进 15°,取出最后一层表征。没转的那一组当对照。
对齐用两个量。mutual k-NN(k=10)问:没转时这块的 10 个近邻,转完还剩几个。余弦距离问:同一块转前转后,向量夹角有多大。前者管邻域结构,后者管方向。H&E 上同类组织既该挤在一起,也该指向同一侧。
模型再按训练时有没有旋转增强分成两组,做 t 检验。图 2 用三角标「有增强」、圆点标「无增强」:PathDino、Kaiko-B/L、Hibou-B/L 落在增强组,其余 7 个落在未增强组。
m-kNN 最高的是 PathDino,跨角度均值 0.85;最低的是 Virchow,0.53。余弦距离最稳的是 Hibou-L,0.016;最漂的是 Phikon 2,0.145。增强组在两个指标上都明显更好:m-kNN 的 t = 6.91,余弦距离的 t = −8.88,都是 p < 0.0001。
| 模型 | 训练旋转增强 | 均值 m-kNN ↑ | 均值余弦距离 ↓ |
| PathDino | 有 | 0.85 | 约 0.025 |
| Hibou-L | 有 | 中游(约 0.74) | 0.016 |
| Phikon | 无 | 约 0.80 | 约 0.07 |
| Phikon 2 | 无 | 偏低 | 0.145 |
| Virchow | 无 | 0.53 | 约 0.11 |
图 3 的热图在 45°、135°、225°、315° 最差。作者把原因写在角上:正方形块一转,四角的像素会被裁掉或填进空白,对角比 90°/180°/270° 更伤。PathDino 在正方位上 m-kNN 能到 0.93 附近,对角仍有 0.83;Virchow 对角会掉到 0.46。
模型尺寸对不上不变性。图 2 按参数量画点的大小,最大到约 10 亿。Virchow 是最大的点之一,m-kNN 却垫底。Phikon 2 比前代 Phikon 更新、更大,两个指标都更差。Virchow 2 相对 Virchow 好一截,邻域重合从 0.53 抬到约 0.74,余弦距离从约 0.11 降到约 0.03,图 2 仍标它训练时没有旋转增强。它改的是别的配方,不是这个开关。
两个指标也不齐。Hibou-L 余弦距离第一,m-kNN 只在中游。Conch 余弦距离几乎和 PathDino 一样紧,邻域重合却接近垫底(约 0.66)。方向对齐和近邻几何不是一回事。
冻结核编码器去做 MIL 的人,可以把「训练菜谱里有没有旋转增强」当成一道筛选,而不是可选项。临床流程并不统一切片朝向。块向量随角度漂,滑窗平均或注意力聚合就会把朝向噪声写进整张片子的统计量。
这是一篇测量论文,没有新结构。结论也符合 ViT 的构造:旋转不变性不会白送,训练时转一转就能补上大半。PathDino 本身按「旋转无关」来设计(HistoRotate,360° 全转),m-kNN 第一是预期内的结果。不要默认更新、更大的权重更稳,Phikon 2 是反例。
只有肾癌一个数据集,363 张片子。没有接到任何下游头,邻域重合高不等于分级或检出更准。抽了多少 patch,N 没披露。
45° 附近的变差和重采样伪影缠在一起。正方形离开坐标轴,角上会丢组织或填空白,这和「模型不认转过的腺腔」不是同一个失败。作者自己点了角落像素,但没有把伪影和控制旋转拆开。
t 检验是观察性的。两组模型在预训练数据、自监督配方、尺寸上本来就不齐,相关推不出「加上旋转增强就够」。也没有拿同一个模型加/不加增强做对照。12 个全是 Transformer,归纳偏置那条假说没有 CNN 或群等变网络垫底。染色、扫描设备、倍率都没测,作者把这些留给后续。